NVIDIA Mellanox 920-9B210-00FN-0D0 in der Praxis: Aufbau eines NDR Low-Latency Fabrics für KI-Cluster mit Billionen von Parametern
August 26, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 in der Praxis: Aufbau eines NDR Low-Latency-Netzwerks für KI-Cluster mit Billionen von Parametern
Hintergrund & Die Herausforderung: Wenn HDR auf Modelle mit Billionen von Parametern trifft
Eine führende KI-Forschungsorganisation hat kürzlich ihr Trainingscluster für große Sprachmodelle von 1.024 auf 4.096 NVIDIA H100 GPUs skaliert, mit dem Ziel, die Trainingszeit für ein 1,8-Billionen-Parameter-Sparse-MoE-Modell (Mixture of Experts) von Monaten auf unter zwei Wochen zu verkürzen. Während der anfänglichen Validierung stellte das Team jedoch eine starke Überlastung in der All-to-All-Kommunikationsphase seines bestehenden 200-Gbit/s-HDR-Netzwerks fest, was zu einem Einbruch der GPU-Auslastung von erwarteten 85 % auf nur 52 % führte – weit unter dem Schwellenwert, der zur Einhaltung des ehrgeizigen Trainingsziels erforderlich ist.
Die Netzwerkanalyse ergab, dass die All-to-All-Kollektivoperationen, die für MoE-Architekturen unerlässlich sind, die HDR-Links sättigten und Congestion-Control-Mechanismen auslösten, die die Latenz weiter erhöhten. Die Organisation benötigte ein Netzwerk, das deterministische Latenzen im Sub-Mikrosekundenbereich über Tausende von Endpunkten hinweg liefern und gleichzeitig den Bandbreitenpuffer bieten konnte, um Traffic-Spitzen ohne Leistungseinbrüche aufzufangen. Genau dieser Herausforderung wurde der NVIDIA Mellanox 920-9B210-00FN-0D0 gerecht.
Lösung & Bereitstellung: Ein 400-Gbit/s-NDR-Netzwerk für Exascale-KI
Die Organisation setzte den 920-9B210-00FN-0D0 InfiniBand-Switch OPN (Ordering Part Number) als Grundlage für ein neues zweistufiges Leaf-Spine-Netzwerk ein. Auf der Leaf-Ebene erhielt jeder Rack zwei 920-9B210-00FN-0D0 MQM9790-NS2F 400-Gbit/s-NDR-Switches, die 128 Ports mit 400-Gbit/s-Konnektivität für 64 Dual-Port-H100-Server pro Rack über OSFP-zu-OSFP-Aktivkabel bereitstellten. Auf der Spine-Ebene verbanden 16 weitere 920-9B210-00FN-0D0-Switches alle Leaf-Switches und schufen so einen nicht blockierenden Fat-Tree mit einer vollen Bisektionsbandbreite von 51,2 Tbit/s pro Spine-Ebene.
Was diese Lösung besonders überzeugend machte, war die integrierte SHARPv3-Technologie (Scalable Hierarchical Aggregation and Reduction Protocol) des Switches. Für die MoE-Workload wurde die All-to-All-Kommunikation direkt auf das Netzwerk des Switches ausgelagert, wobei die Switches die Datenreduktion und -umverteilung im Netzwerk durchführten. Dies eliminierte die Notwendigkeit mehrerer Host-seitiger Durchläufe und reduzierte den Kommunikations-Overhead, der die vorherige HDR-Bereitstellung beeinträchtigt hatte, drastisch.
Laut dem 920-9B210-00FN-0D0 Datenblatt liefert der Switch eine Cut-Through-Latenz von unter 100 ns, was während der Proof-of-Concept-Phase validiert wurde. Das Ingenieurteam bestätigte auch, dass das 920-9B210-00FN-0D0 kompatible Ökosystem alle OSFP-Optiken und Kabel enthielt, die sie bereits qualifiziert hatten, wodurch Beschaffungsverzögerungen entfielen. Die 920-9B210-00FN-0D0 Spezifikationen – einschließlich redundanter Netzteile und Hot-Swap-fähiger Lüfter – gaben dem Team Vertrauen in die Erreichung ihres Verfügbarkeitsziels von 99,999 % für das Produktionscluster.
Ergebnisse & Messbare Gewinne: Vom Engpass zum Ermöglicher
Nach der vollständigen Bereitstellung des NDR-Netzwerks und dem Neustart des MoE-Trainingsjobs maß die Organisation transformative Verbesserungen in mehreren Dimensionen:
- Wiederherstellung der GPU-Auslastung: Die durchschnittliche GPU-Auslastung stieg von 52 % auf 89 %, wobei die Spitzenauslastung während rechenintensiver Phasen 94 % erreichte – ein direktes Ergebnis der Beseitigung netzwerkbedingter Ausfallzeiten.
- Reduzierung der All-to-All-Latenz: Die für einen vollständigen All-to-All-Austausch über 4.096 GPUs erforderliche Zeit sank von 180 ms auf unter 45 ms, eine Verbesserung um 75 %, die sich direkt in schnelleren Trainingsiterationen niederschlug.
- Job-Abschlusszeit: Die prognostizierte Trainingszeit für das 1,8-T-MoE-Modell wurde von 14 Tagen auf nur 9 Tage reduziert – eine Beschleunigung um 36 %, die sowohl die Markteinführungszeit als auch die Cloud-Compute-Kosten erheblich senkte.
- Betriebliche Effizienz: Mit 64 Ports pro Switch wurde die Anzahl der benötigten Spine-Switches im Vergleich zu einem 40-Port-HDR-Design um 37 % reduziert, was die Verkabelung vereinfachte und den Stromverbrauch pro Rack um 28 % senkte.
Aus Sicht der Gesamtbetriebskosten stellte das Finanzteam der Organisation fest, dass der 920-9B210-00FN-0D0 Preis pro Einheit zwar höher war als die HDR-Alternative, die Netzwerkkosten pro GPU jedoch aufgrund der höheren Radix und der reduzierten Switch-Schichtanzahl tatsächlich sanken. Dieser wirtschaftliche Vorteil, kombiniert mit den dramatischen Leistungssteigerungen, machte das NDR-Upgrade zu einem klaren Geschäftserfolg. Die 920-9B210-00FN-0D0 InfiniBand-Switch OPN-Lösung ließ sich auch nahtlos in ihre bestehende NVIDIA UFM-Bereitstellung integrieren und bot zentrale Transparenz und automatisierte Alarmierung, was den Betriebsaufwand um 40 % reduzierte.
Zusammenfassung & Ausblick: Die NDR-Grundlage für KI der nächsten Generation
Der NVIDIA Mellanox 920-9B210-00FN-0D0 erwies sich als die transformative Lösung, die diese KI-Forschungsorganisation benötigte, um das volle Potenzial ihres 4.096-GPU-H100-Clusters auszuschöpfen. Durch die Bereitstellung von 400-Gbit/s-NDR-Bandbreite, 64-Port-Dichte und SHARPv3-In-Network-Computing ermöglichte der Switch die Skalierung von 1.024 auf 4.096 GPUs, ohne Leistung oder Verwaltbarkeit zu beeinträchtigen – eine Leistung, die mit ihrer früheren HDR-Infrastruktur unmöglich gewesen wäre.
Mit Blick auf die Zukunft plant die Organisation, innerhalb der nächsten 18 Monate auf 8.192 GPUs zu erweitern und dabei den 920-9B210-00FN-0D0 zum Verkauf über die Vertriebspartner von NVIDIA zu nutzen, um ein noch größeres dreistufiges Folded-Clos-Netzwerk aufzubauen. Für Organisationen, die ihre Investitionen in KI- und HPC-Netzwerke der nächsten Generation bewerten, bietet der 920-9B210-00FN-0D0 eine bewährte, produktionsbereite Lösung, die das Versprechen der Low-Latency-RDMA-Interconnect-Optimierung im Exascale-Bereich erfüllt.

