NVIDIA Mellanox MQM9790-NS2F in Aktion: Aufbau eines Low-Latency RDMA Fabrics für KI- und HPC-Cluster
August 24, 2026
NVIDIA Mellanox MQM9790-NS2F in Aktion: Aufbau eines RDMA-Netzwerks mit geringer Latenz für KI- und HPC-Cluster
Hintergrund & Die Herausforderung: Wenn Scale-Out zum Engpass wird
Wenn große Sprachmodelle von Tausenden auf Zehntausende von GPUs skaliert werden und Wettersimulationen sich der Kilometer-Auflösung nähern, werden die Grenzen traditioneller Ethernet-Netzwerke offensichtlich. In diesen Umgebungen stellen MPI-Kollektivkommunikationsmuster – wie All-Reduce und All-to-All – extreme Anforderungen an die Netzwerklatenz und die Staukontrolle. Ohne eine speziell entwickelte Interconnect-Lösung verbringen selbst die leistungsstärksten Rechenknoten einen erheblichen Teil ihrer Zyklen mit dem Warten auf Daten, was teure GPU-Ressourcen effektiv verschwendet.
Dies ist genau die Herausforderung, der sich der NVIDIA Mellanox MQM9790-NS2F stellt. Als 400Gb/s NDR InfiniBand-Switch mit 64 OSFP-Ports ist er darauf ausgelegt, deterministische Latenzen im Sub-Mikrosekundenbereich über Tausende von Endpunkten hinweg zu liefern und so eine echte lineare Skalierung für verteilte Workloads zu ermöglichen.
Lösung & Bereitstellung: Ein Leaf-Spine-Netzwerk für RDMA
In einem typischen Bereitstellungsszenario für ein großes KI-Forschungslabor bildet der MQM9790-NS2F InfiniBand-Switch den Kern einer zweistufigen Leaf-Spine-Topologie. Auf der Leaf-Ebene ist jeder Compute-Rack mit einer oder zwei MQM9790-NS2F-Einheiten ausgestattet, die 64 Ports mit 400Gb/s-Konnektivität zu GPU-Servern über OSFP-zu-OSFP-Direct-Attach-Kupferkabel oder aktive optische Kabel bereitstellen. Auf der Spine-Ebene verbinden zusätzliche MQM9790-NS2F-Switches die Leaves und bilden ein nicht blockierendes Fat-Tree-Netzwerk mit voller Bisektionsbandbreite.
Was diese Lösung besonders überzeugend macht, ist die native Unterstützung des Switches für RDMA over Converged Ethernet (RoCE) im InfiniBand-Modus – obwohl hier die nativen RDMA-Fähigkeiten von InfiniBand für noch geringere Latenz und CPU-Offload genutzt werden. Der MQM9790-NS2F 400Gb/s NDR 64-Port OSFP integriert die SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol)-Technologie von NVIDIA, die Kollektivoperationen direkt auf das Netzwerk-Fabric auslagert. In der Praxis bedeutet dies, dass eine All-Reduce-Operation, die normalerweise mehrmals durch das Netzwerk laufen würde, nun in einem einzigen Durchgang abgeschlossen wird, was die Job-Abschlusszeiten für kommunikationsintensive Workloads um bis zu 30 % reduziert.
Für Netzwerkarchitekten, die die MQM9790-NS2F InfiniBand-Switch-Lösung evaluieren, wird der Bereitstellungsprozess durch NVIDIAs Unified Fabric Manager (UFM) vereinfacht. UFM bietet zentrale Transparenz über den Zustand des Netzwerks, automatische Topologieerkennung und proaktive Staukontrolle – kritische Funktionen bei der Verwaltung von Netzwerken mit über 2.000 Ports. Frühe Anwender berichten, dass das MQM9790-NS2F-kompatible Ökosystem, das eine breite Palette von NVIDIA-zertifizierten Kabeln und Transceivern umfasst, die Beschaffung vereinfacht und das Bereitstellungsrisiko reduziert.
Ergebnisse & Messbare Gewinne: Von der Theorie zur Produktionsrealität
In einer kürzlich durchgeführten Produktionsbereitstellung für einen 2.048-GPU-Cluster, der für das Training großer Transformer-Modelle bestimmt ist, führte das Upgrade von HDR (200Gb/s) auf NDR (400Gb/s) Infrastruktur – mit dem NVIDIA Mellanox MQM9790-NS2F im Zentrum – zu messbaren Verbesserungen in mehreren Dimensionen:
- Reduzierung der Job-Abschlusszeit: End-to-End-Trainingsiterationen für ein Modell mit 175 Milliarden Parametern reduzierten sich um 28 %, was hauptsächlich auf das SHARPv3-Offloading und die reduzierte Tail-Latenz zurückzuführen ist.
- Netzauslastung: Die durchschnittliche Netzauslastung stieg von 62 % auf 89 %, ohne dass es zu einem Staukollaps kam, dank der fortschrittlichen adaptiven Routing- und Staukontrollmechanismen des Switches.
- Betriebliche Einfachheit: Mit 64 Ports pro Switch wurde die Anzahl der benötigten Spine-Switches im Vergleich zu einem 32-Port-HDR-Design halbiert, was die Verkabelungskomplexität und den Stromverbrauch pro Rack erheblich reduziert.
Laut den MQM9790-NS2F-Spezifikationen liefert der Switch eine Port-zu-Port-Latenz von unter 100 ns und unterstützt eine aggregierte Schaltkapazität von bis zu 51,2 Tb/s – Werte, die eng mit der in dieser Bereitstellung beobachteten Leistung übereinstimmen. Netzwerktechniker stellten auch fest, dass das MQM9790-NS2F-Datenblatt die reale Leistung genau widerspiegelte, ohne Überraschungen während der Validierungsphase.
Aus TCO-Sicht reduzierte die Fähigkeit, mehr Endpunkte pro Switch-Ebene zu konsolidieren, direkt die Investitionsausgaben. Obwohl die anfänglichen MQM9790-NS2F-Preise höher sind als bei gleichwertigen 200Gb/s-Lösungen, sanken die Netzwerkkosten pro GPU aufgrund der höheren Radix und der reduzierten Anzahl von Switch-Ebenen tatsächlich. Dieser wirtschaftliche Vorteil, kombiniert mit den Leistungssteigerungen, machte den Business Case für das Lenkungskomitee des Labors klar.
Zusammenfassung & Ausblick: Die NDR-Grundlage für Exascale Computing
Der NVIDIA Mellanox MQM9790-NS2F ist mehr als ein inkrementelles Upgrade – er stellt einen grundlegenden Wandel in der Gestaltung von HPC- und KI-Clustern dar. Durch die Bereitstellung von 400Gb/s NDR-Bandbreite, 64-Port-Dichte und In-Network-Compute-Beschleunigung in einem einzigen 1U-Formfaktor ermöglicht er Architekten den Aufbau von Netzwerken, die bis zu Zehntausende von Endpunkten skalieren, ohne Leistung oder Verwaltbarkeit zu beeinträchtigen.
Mit Blick auf die Zukunft, da Workloads weiterhin höhere Bandbreiten und geringere Latenzen erfordern, wird der MQM9790-NS2F InfiniBand-Switch als grundlegender Baustein für Exascale-Systeme der nächsten Generation dienen. Seine Kompatibilität mit bestehenden NVIDIA Quantum-2-Plattformen und die nahtlose Integration mit UFM gewährleisten einen reibungslosen Migrationspfad für Organisationen, die von HDR-Netzwerken aufrüsten. Für IT-Manager und Architekten, die ihre Netzwerkinvestitionen der nächsten Generation bewerten, bietet der MQM9790-NS2F eine bewährte, produktionsbereite Lösung, die das Versprechen der Optimierung von RDMA-Interconnects mit geringer Latenz erfüllt.

