Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand-Switch in Aktion

July 13, 2026

Neueste Unternehmensnachrichten über Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand-Switch in Aktion

Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand Switch in Aktion – Verbindungsoptimierung mit geringer Latenz für RDMA/HPC/AI-Cluster

Da KI-Trainingscluster von Tausenden auf Zehntausende GPUs skaliert werden, werden Netzwerklatenz und Überlastungskontrolle zu entscheidenden Faktoren für eine effektive Rechennutzung. Eine führende globale KI-Forschungsorganisation hat kürzlich das eingeführtMellanox (NVIDIA Mellanox) MQM9790-NS2FSwitch, um seine Supercomputing-Einrichtung der nächsten Generation zu unterstützen und umfangreiche Sprachmodelle, Molekulardynamiksimulationen und verteiltes Deep Learning zu unterstützen. In diesem Artikel wird die reale Bereitstellung untersucht und detailliert beschrieben, wie dieser InfiniBand-Switch RDMA-Transport, HPC-Kommunikation und KI-Daten-parallele Trainingsstrukturen transformiert.

Hintergrund und Herausforderungen: Vom Ethernet-Kompromiss zum Gebot der verlustfreien Verbindung

Die Organisation setzte zunächst auf eine 100-GbE-Ethernet-Fabric mit RoCEv2. Als ihre GPU-Knoten jedoch auf über 1.200 Server anwuchsen (jeder mit 8× NVIDIA H100-GPUs), kam es zu anhaltenden PFC-Deadlocks, komplexer ECN-Abstimmung und gelegentlichen Paketverlusten, die zu Trainingsverzögerungen führten. Diese Probleme verlängerten die durchschnittliche Auftragserledigungsdauer um mehr als 35 % und erforderten einen erheblichen technischen Aufwand bei der Fehlerbehebung im Netzwerk. Die bestehende Infrastruktur konnte nicht mehr die deterministische Latenz im Mikrosekundenbereich und den überlastungsfreien Durchsatz liefern, der für massive All-Reduce- und All-to-All-Kollektivoperationen erforderlich ist.

Lösung und Bereitstellung: DieMQM9790-NS2F InfiniBand-Switchals Fabric Backbone

Nach der Bewertung mehrerer Alternativen wählte das Team die ausNVIDIA Mellanox MQM9790-NS2Fals Kernbaustein für eine neue zweistufige Leaf-Spine-Architektur. Jeder Laubständer ist mit zwei ausgestattetMQM9790-NS2F 400 Gbit/s NDR 64-Port OSFPSwitches mit 64 OSFP-Ports pro Einheit und einer Gesamt-Switching-Kapazität von 25,6 Tbit/s. Die NDR-Geschwindigkeit von 400 Gbit/s pro Port ermöglicht in Kombination mit Cut-Through-Switching und adaptivem Routing eine Port-zu-Port-Latenz von unter 600 ns – eine entscheidende Voraussetzung für ihre GPU-intensiven Arbeitslasten. Die Bereitstellung nutzte dieMQM9790-NS2F InfiniBand-Switch-LösungIntegriert in die NVIDIA Quantum-2-Firmware, um eine nahtlose Übertragung zu gewährleistenMQM9790-NS2F kompatibelBetrieb mit vorhandenen ConnectX-7-Adaptern und BlueField-3-DPUs.

Zu den wichtigsten Bereitstellungsoptionen gehörten:

  • Topologie:Blockierungsfreier Fat Tree mit 64-Port-OSFP-zu-400G-optischen Transceivern, der eine vollständige Halbierungsbandbreite für alle GPU-Knoten ermöglicht.
  • Management:NVIDIA UFM (Unified Fabric Manager) für Echtzeit-Telemetrie, Überlastungserkennung und proaktive Pfadumleitung.
  • Sammelabladung:SHARPv3 ist aktiviert, um alle Reduce-Vorgänge zu beschleunigen und die Kommunikation von den Host-CPUs zu entlasten.

Um einen reibungslosen Übergang zu gewährleisten, konsultierte das Team dieMQM9790-NS2F DatenblattUndMQM9790-NS2F-Spezifikationenzur Validierung der Strom- und Verkabelungsanforderungen. Der 1U-Formfaktor und die redundanten Netzteile passen perfekt in die bestehende Rackdichte, und die OSFP-Ports unterstützen sowohl DAC-Kabel als auch optische Module und bieten so Flexibilität für zukünftige Erweiterungen.

Gemessene Ergebnisse und Vorteile – quantifizierbare Leistungs- und Effizienzsteigerungen

Nach vollständiger Bereitstellung und Optimierung dokumentierte die Organisation erhebliche Verbesserungen in mehreren Dimensionen:

Metrisch Vorher (RoCEv2) Nachher (MQM9790-NS2F)
Durchschnittliche All-Reduce-Latenz (1 GB) ~18 μs < 8 μs
Tail-Latenz (99,9 %ile) > 150 μs < 15 μs
Effektive GPU-Auslastung ~72 % ~91 %
Auftragsabschlusszeit (Durchschnitt) Grundlinie -28 % (1,4-mal schneller)

Über die reinen Zahlen hinaus meldete das Team nahezu keine überlastungsbedingten Unterbrechungen, was den Netzwerkbetrieb erheblich vereinfachte. Die integrierte Telemetrie und das adaptive Routing desNVIDIA Mellanox MQM9790-NS2Fermöglichte einen automatischen Lastausgleich über alle 64 OSFP-Ports, wodurch manuelle ECN-Optimierungen entfielen. Darüber hinaus ist dieMQM9790-NS2F InfiniBand-Switchlieferte deterministische Leistung selbst bei einer Verbindungsauslastung von 95 % – eine Leistung, die mit ihrem vorherigen Ethernet-Setup unmöglich war.

Die Organisation stellte außerdem fest, dass dieMQM9790-NS2F PreisDie Amortisierung über den 5-Jahres-Lebenszyklus wurde durch einen geringeren Stromverbrauch pro Port (≈1,5 W pro 400G-Port) und geringere Verkabelungskosten aufgrund einer höheren Portdichte ausgeglichen. Da die allgemeine Verfügbarkeit nun ausgereift ist, haben sie dies bestätigtMQM9790-NS2F zu verkaufenüber autorisierte Kanäle wurde die Beschaffung unkompliziert und dieMQM9790-NS2F DatenblattBereitstellung aller erforderlichen Installations- und Compliance-Details.

Zusammenfassung und Ausblick – Eine Blaupause für KI-Infrastrukturen der nächsten Generation

Die Annahme desMellanox (NVIDIA Mellanox) MQM9790-NS2Fin diesem groß angelegten HPC/KI-Cluster zeigt, dass eine speziell entwickelte InfiniBand-Struktur kein Luxus mehr, sondern eine Notwendigkeit für Unternehmen ist, die die Grenzen von KI und wissenschaftlichem Rechnen erweitern. Durch die Bereitstellung einer konsistenten Latenzzeit von weniger als einer Mikrosekunde, verlustfreiem RDMA-Transport und netzwerkinterner Rechenbeschleunigung bietet dasMQM9790-NS2F 400 Gbit/s NDR 64-Port OSFPDer Switch ermöglicht Rechenzentren eine nahezu lineare Skalierbarkeit auf bis zu Zehntausende GPUs.

Für die Zukunft plant das Team, den Stoff um weitere zu erweiternMQM9790-NS2F InfiniBand-SwitchEinheiten zur Unterstützung künftiger Workloads der Exascale-Klasse, einschließlich Klimamodellierung und Genomik. DerMQM9790-NS2F kompatibelÖkosystem mit zukünftigen NVIDIA-Generationen sorgt für Investitionsschutz. Für Architekten und IT-Manager, die ähnliche Upgrades evaluieren, bestätigt dieser reale Fall, dass dieMQM9790-NS2F InfiniBand-Switch-Lösungbietet einen bewährten, kostengünstigen Weg zu leistungsstarken Cluster-Netzwerken mit geringer Latenz – ein entscheidender Wegbereiter für das nächste Jahrzehnt der KI-Innovation.