NVIDIA Mellanox 920-9B210-00FN-0D0 in der Praxis: Aufbau eines NDR-Low-Latency-Fabric für MoE-Modelle mit Billionen von Parametern
August 27, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 in der Praxis: Aufbau eines NDR-Low-Latency-Fabrics für Trillion-Parameter-MoE-Modelle
Hintergrund und Herausforderung: Wenn alles für alle zum Engpass wird
Eine führende KI-Forschungsorganisation hat kürzlich ihren großen Sprachmodell-Trainingscluster von 1.024 auf 4.096 NVIDIA H100-GPUs vergrößert, mit dem ehrgeizigen Ziel, die Trainingszeit für einen 1.8-Billionen-Parameter spärliches MoE-Modell (Mischung von Experten) von Monaten bis weniger als zwei WochenWährend der ersten Validierung wurde jedoch the team discovered that their existing 200Gb/s HDR network was experiencing severe congestion during the all-to-all communication phase—a characteristic pattern of MoE architectures—causing GPU utilization to plummet from an expected 85% to just 52%, weit unter dem Schwellenwert, der für die Erfüllung der Ausbildungsfrist erforderlich ist.
Die Analyse des Netzwerks ergab, dass die kollektive Kommunikation von allen zu allen mehr als 40% des Kommunikationsbedarfs des MoE-Modells ausmachte.Das Verkehrsmuster wurde zunehmend fragmentiert und zerbrochenDas bestehende HDR-Netzwerk erlebte nach Auslösung der Überlastungskontrollmechanismen eine dramatische Erhöhung der Latenzzeit, wodurch ein erheblicher Teil der GPUs in leeres Betrieb blieb.Die Organisation benötigte dringend ein Netzwerk, das eine deterministische Sub-Mikrosekunden-Latenz liefern kann., Verlustfreier Transport und massiver, nicht blockierender SkalierbarkeitNVIDIA Mellanox 920-9B210-00FN-0D0wurde speziell für diese Herausforderung entwickelt.
Lösung und Bereitstellung: Eine MoE-optimierte NDR Leaf-Spine-Architektur
Die Organisation hat ein zweistufiges Blatt-Rückgrat-Gewebe eingesetzt, das um die920-9B210-00FN-0D0 InfiniBand-Schalter OPNIn jedem Rechnerrack sind zwei920-9B210-00FN-0D0 MQM9790-NS2F 400 Gbit/s NDRSchalter wurden an der Blattschicht eingesetzt, die eine Konnektivität von 400 Gb/s zu 64 H100-Servern mit zwei Ports über OSFP-OSFP-aktive optische Kabel bereitstellen.16 weitere 920-9B210-00FN-0D0 Schalter miteinander verbunden alle Blattschalter, um ein vollständig nicht blockierendes Fat-Tree-Gewebe mit einer Gesamtbissektionsbandbreite von 51,2 Tb/s zu schaffen.
Das Herzstück dieser Lösung ist die integrierte SHARPv3-Technologie (Scalable Hierarchical Aggregation and Reduction Protocol).All-to-all-Kommunikation wurde direkt auf den Schalter-Stoff abgeladen., wobei die Switches die Datenreduktion und -verteilung im Netzwerk durchführen.Das Projekt hat die Kommunikationskosten, die bei der bisherigen Bereitstellung von HDR bestehen, drastisch reduziert.. DieDatenblatt 920-9B210-00FN-0D0die durchschnittliche Latenzzeit von unter 100 ns, die während der Proof-of-Concept-Phase validiert wurde und sich als entscheidend für die strengen Latenzanforderungen des MoE-Arbeitsaufwands erwiesen hat.
DieSpezifikationen 920-9B210-00FN-0D0¥einschließlich doppelt redundanter Stromversorgungen und warmwechselbarer Ventilatoren ¥gab dem Team das Vertrauen in die Erreichung ihres 99,999%-Verfügbarkeitsziels.920-9B210-00FN-0D0 kompatibelDas Ökosystem umfasste alle OSFP-Optiken und -Kabel, die sie bereits qualifiziert hatten, wodurch Verzögerungen bei der Beschaffung beseitigt und der Zeitplan für den Einsatz vereinfacht wurde.
Ergebnisse und messbare Gewinne: Vom Engpass zum Förderer
Nachdem das NDR-Gewebe vollständig eingesetzt und die Ausbildung des Ministeriums für Energie wieder aufgenommen wurde, maß die Organisation transformierende Verbesserungen in mehreren Dimensionen:
- Wiederherstellung der GPU-Nutzung:Die durchschnittliche GPU-Auslastung stieg von 52% auf 89%, wobei die Spitzennutzung während rechnerintensiver Phasen 94% erreichte, was direkt auf die Beseitigung von Netzwerk-induzierten Stalls zurückzuführen ist.
- All-to-all-Latenzreduktion:Die für einen vollständigen All-to-All-Austausch über 4.096 GPUs erforderliche Zeit sank von 180ms auf unter 45ms, eine 75%ige Verbesserung, die sich direkt in schnellere Trainingsiterationen niedersetzte.
- Zeit für die Fertigstellung:Der geplante Trainingszeitraum für das 1,8 T-MoE-Modell wurde von 14 auf nur 9 Tage reduziert - eine Beschleunigung von 36%, die sowohl die Time-to-Market- als auch die Cloud-Computing-Kosten erheblich reduzierte.
- Betriebseffizienz:Mit 64 Ports pro Schalter wurde die Anzahl der benötigten Spine-Switches im Vergleich zu einem 40-Port-HDR-Design um 37% reduziert, wodurch die Verkabelung vereinfacht und der Stromverbrauch pro Rack um 28% reduziert wurde.
Aus der Sicht der Gesamtbetriebskosten stellte das Finanzteam der Organisation fest, daß920-9B210-00FN-0D0 PreisDie Kosten für die Netzwerkverbindung pro GPU gingen aufgrund der höheren Radix und der geringeren Anzahl von Schaltschichten zurück.Zusammen mit den dramatischen Leistungssteigerungen, machte das NDR-Upgrade ein klarer Geschäftsgewinn.920-9B210-00FN-0D0 InfiniBand-Switch-OPN-LösungSie wurden auch nahtlos mit ihrem bestehenden NVIDIA UFM-Einsatz integriert, um eine zentrale Sichtbarkeit und automatisierte Warnungen zu bieten, die den Betriebskosten um 40% verringert haben.
Zusammenfassung und Ausblick: Die NDR-Stiftung für Next-Gen-MoE-Workloads
DieNVIDIA Mellanox 920-9B210-00FN-0D0Das war die transformative Lösung, die diese KI-Forschungsorganisation brauchte, um das volle Potenzial ihres H100-Clusters mit 4.096-GPU freizuschalten.und SHARPv3 im Netzwerk, der Wechsel ermöglichte es ihnen, von 1.024 auf 4.096 GPUs zu skalieren, ohne dabei die Leistung oder Handhabbarkeit zu beeinträchtigen - eine Leistung, die mit ihrer bisherigen HDR-Infrastruktur unmöglich gewesen wäre.
Im Hinblick auf die Zukunft plant die Organisation, innerhalb der nächsten 18 Monate auf 8.192 GPUs zu expandieren.920-9B210-00FN-0D0 zum VerkaufFür Unternehmen, die ihre Investitionen in KI- und HPC-Netzwerke der nächsten Generation bewerten, bietet NVIDIA ein neues System für die Entwicklung von HPC-Netzwerken.Die 920-9B210-00FN-0D0 bietet eine bewährte, eine produktionsfähige Lösung, die das Versprechen einer RDMA-Verbindungsoptimierung mit geringer Latenzzeit auf Exaskala erfüllt.

