NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch in Aktion: Optimierung der Low-Latency-Verbindung für RDMA/HPC/AI-Cluster
August 21, 2026
NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch in Aktion: Optimierung der Low-Latency-Verbindung für RDMA/HPC/AI-Cluster
Im Bereich der groß angelegten Ausbildung von KI-Modellen und des Hochleistungsrechners (HPC) wird die Netzwerklatenz oft zum kritischen Engpass, der die Skalierbarkeit und Effizienz von Clustern einschränkt.Ein nationales Superrechenzentrum hat kürzlich eine umfangreiche Infrastrukturerweiterung abgeschlossen, der Übergang von einem 100Gb/s EDR InfiniBand-Fabrik zu einer 200Gb/s HDR-Lösung, dieNVIDIA Mellanox MQM8790-HS2FDiese Fallstudie untersucht die Herausforderungen, denen sie gegenüberstanden, die Bereitstellungsstrategie und die messbaren Leistungssteigerungen, die durch diese Interkonnektion der nächsten Generation erzielt wurden.
Hintergrund und Herausforderungen: Wenn Latenz die Leistungsobergrenze wird
Das Supercomputing-Zentrum betreibt einen heterogenen Cluster mit über 2.000 GPU-Knoten, der eine Vielfalt an Arbeitsbelastungen unterstützt, darunter Wettersimulation, Genomforschung,und große Sprachmodell-AusbildungMit dem bisherigen EDR-Netzwerk von 100 Gb/sDas Operationsteam stellte fest, dass kollektive Kommunikationsvorgänge wie all-reduce und all-gather einen zunehmenden Anteil an der gesamten Arbeitszeit verbrauchen, da die Zahl der Knoten zunimmt.Bei einigen verteilten Schulungsarbeiten machten netzwerkbezogene Gemeinkosten fast 40% der End-to-End-Ausführungszeit aus, was die GPU-Auslastung stark einschränkte und die Modellkonvergenzzyklen verlängerte.
Weitere Herausforderungen waren:
- Verkehrsüberlastungsplätze:Verkehrsmuster in der KI-Ausbildung sind oft sprunghaft und unvorhersehbar, was zu Blockaden an der Spitze und Spitzen in der Latenzzeit führt, die die Arbeitsplanung stören.
- Unzureichende Beschleunigung im Netz:Der Legacy-Fabrik fehlte die Unterstützung für erweiterte kollektive Ablastfähigkeiten, was alle Reduktionsoperationen zwang, die Host-CPU- und Speicherhierarchie zu durchqueren.
- Komplexität der Verwaltung:Die Fehlerbehebung von Leistungsproblemen erforderte eine manuelle Analyse mehrerer Überwachungstools, was es schwierig macht, die Ursachen bei groß angelegten Einsätzen zu ermitteln.
Nach der Auswertung mehrerer Verbindungsmöglichkeiten wählte das Zentrum dieMQM8790-HS2FDas ist die Grundlage für das neue Gewebe.Datenblatt MQM8790-HS2F, dieser Switch liefert 40 Ports von 200Gb/s HDR-Non-Blocking-Durchsatz, Sub-130ns Cut-Through-Latenz und Unterstützung für SHARP v3.0 kollektive OffloadKapazitäten, die ihre Schmerzpunkte direkt angegangen haben.
Lösung und Bereitstellung: Aufbau eines Low-Latency Fabrics für KI/HPC
Die Bereitstellung nahm eine zweistufige Fat-Tree-Topologie an, mit 24MQM8790-HS2F 200Gb/s HDR 40-Port QSFP56Diese Konfiguration stellte 2 Schalter zur Verfügung:1 überschüssiges Angebot für den gesamten Cluster ausreichend für die aktuelle Arbeitsbelastung und gleichzeitig für zukünftige Erweiterungen.
| Bereitstellungsschicht | Anzahl der Schalter | Verwendete Häfen | Verbindungsfähigkeit |
|---|---|---|---|
| Blatt (pro Regal) | 24 | 32 Häfen je | ToR-Server + Spine-Uplinks |
| Rückenwirbel | 8 | je 36 Häfen | Vollmaschen für alle Blattschalter |
Jeder Blattschalter verbindet sich mit Rechenknoten über NVIDIA ConnectX-6 HDR Host Channel Adapter.MQM8790-HS2F kompatibelDas Team konnte die vorhandenen QSFP56-Kabel wiederverwenden, wodurch die Bereitstellung beschleunigt und die Beschaffungskosten gesenkt wurden.mit der Steuerungsebene, die den Unified Fabric Manager (UFM) von NVIDIA für die automatisierte Topologieentdeckung und Bereitstellung nutzt.
Die Unterstützung des Switches für adaptive Routing- und Stausteuerung erwies sich als entscheidend für die Bewältigung des aufgeblasenen Verkehrs, das für KI-Workloads charakteristisch ist.Durch dynamische Umverteilung der Flüsse über die verfügbaren Pfade, dieMQM8790-HS2F InfiniBand-Schalterdie Bildung von Hotspots minimiert und die Leistung auch während der Arbeitsplanspitze gleichbleibend gehalten.
Ergebnisse und Gewinne: Messbare Verbesserungen der Arbeitsleistung und der GPU-Nutzung
Nach drei Monaten Produktionsbetrieb berichtete das Superrechenzentrum von signifikanten Leistungssteigerungen in mehreren Dimensionen:
- Verringerung der Latenzzeit:Die durchschnittliche MPI-Pingpong-Latenz sank von 680 ns auf dem vorherigen EDR-Textil auf unter 130 ns mit demNVIDIA Mellanox MQM8790-HS2F, was eine 5-fache Verbesserung der Effizienz des Nachrichtenaustauschs bedeutet.
- Beschleunigung der kollektiven Operation:All-Reducing-Latenz für 1024-Knoten-Jobs sank um 62%, dank SHARP v3.0 Offload, das Reduktionsoperationen direkt innerhalb des Switch-Gewebes durchführt.
- GPU-AuslastungDer kombinierte Effekt von niedrigerer Latenz und höherer Bandbreite drückte die durchschnittliche GPU-Auslastung von 72% auf 91%, was sich in einer Verringerung der Zeit bis zur Lösung für große Sprachmodell-Trainings um 26% niedersetzte.
- Effizienz der Arbeitsplanung:Die reduzierte Tail-Latency-Varianz ermöglichte es dem SLURM-Scheduler, mehr Jobs ohne Leistungsstörungen auf denselben Knotenstamm zu packen, was den Gesamtdurchsatz des Clusters um etwa 18% erhöhte.
Als das Team später dieMQM8790-HS2F Preisgegen alternative Schalter anderer Anbieter, they found that the total cost per Gb/s delivered was highly competitive—especially when factoring in the reduced management overhead and the switch's ability to support both HDR and HDR100 link speeds, die Investitionen in gemischte Geschwindigkeitsumgebungen schützen.
Aus betriebswirtschaftlicher Sicht stellte die integrierte UFM-Plattform eine einzige Glaswand zur Überwachung der Stoffgesundheit, der Verkehrsmuster und der Fehler auf Verbindungsebene bereit.Diese Sichtbarkeit ermöglichte es dem Team, abbauende Kabel proaktiv zu identifizieren und während der geplanten Wartung zu ersetzen, um ungeplante Ausfallzeiten zu vermeiden.
Zusammenfassung und Aussicht: Ein Vorbild für die nächste Generation von Low-Latency-Geweben
Diese Fallstudie zeigt, daß dieMQM8790-HS2F InfiniBand-Schalterlösungist mehr als ein einfaches Geschwindigkeits-Upgrade, es ist eine transformative Komponente für Organisationen, die das volle Leistungspotenzial ihrer KI- und HPC-Infrastruktur freisetzen möchten.Durch die Kombination der hohen Hafendichte, ultra-niedrige Latenz und In-Network-Computing-Fähigkeiten, adressiert der Switch direkt die Kommunikationsengpässe, die historisch begrenzte Cluster-Skalierbarkeit haben.
Das Supercomputing-Zentrum plant, im nächsten Geschäftsjahr seine Netzwerke auf 2.400 Knoten zu erweitern.MQM8790-HS2FDas Team erforscht auch die Unterstützung des Switches für die erweiterten Reduktionsalgorithmen von SHARP v3.0,Sie verspricht, neue Arbeitslasten wie grafische neuronale Netze und Verstärkungslernen weiter zu beschleunigen..
Für IT-Manager, Netzwerkarchitekten und Ingenieure, die Interkonnektionsoptionen für ihre eigenen Cluster-Builds bewerten, ist dieNVIDIA Mellanox MQM8790-HS2Fbietet einen bewährten, im Feld validierten Weg zur Erreichung von Sub-Mikrosekunden-Latenz, maximierter GPU-Auslastung und vereinfachtem Fabric-Management.Spezifikationen MQM8790-HS2FDer Schalter ist jetzt weit verbreitet.MQM8790-HS2F zum Verkaufdie Suche nach einem regionalen Partner.

