NVIDIA Mellanox 920-9B110-00FH-0D0 in der Praxis: Optimierung von Low-Latency RDMA-Fabrics für HPC- und KI-Cluster

August 25, 2026

Neueste Unternehmensnachrichten über NVIDIA Mellanox 920-9B110-00FH-0D0 in der Praxis: Optimierung von Low-Latency RDMA-Fabrics für HPC- und KI-Cluster

NVIDIA Mellanox 920-9B110-00FH-0D0 in der Praxis: Optimierung von Low-Latency RDMA-Fabrics für HPC- und KI-Cluster

Hintergrund & Die Herausforderung: Wenn HDR-Leistung auf Budgetrealität trifft

Ein mittelgroßes KI-Forschungslabor stand kürzlich vor einer bekannten Herausforderung: Ihr bestehendes 100-Gbit/s-EDR-InfiniBand-Fabric wurde zu einem Engpass für ihren wachsenden GPU-Cluster, der von 128 auf 512 NVIDIA A100-Knoten angewachsen war. Die Trainingszeiten für große Transformer-Modelle hatten sich aufgrund von Netzwerküberlastung während All-Reduce-Operationen um über 40 % erhöht, und das Team benötigte ein Upgrade, das erhebliche Leistungssteigerungen liefern konnte, ohne die Kapitalausgaben, die für eine vollständige 400-Gbit/s-NDR-Bereitstellung erforderlich wären.

Das Labor evaluierte mehrere Optionen und identifizierte 200-Gbit/s-HDR als die ideale Balance zwischen Leistung und Kosten. Sie benötigten jedoch einen Switch, der eine hohe Portdichte, fortschrittliche Staukontrolle und nahtlose Integration mit ihren bestehenden HDR-kompatiblen Kabeln und Transceivern bieten konnte. Genau hier kam der NVIDIA Mellanox 920-9B110-00FH-0D0 ins Spiel – ein Switch, der speziell für Umgebungen entwickelt wurde, in denen HDR ausreichend Bandbreite ohne Überprovisionierung bietet.

Lösung & Bereitstellung: Ein kostoptimiertes HDR-Fabric

Das Labor setzte den 920-9B110-00FH-0D0 InfiniBand Switch OPN (Ordering Part Number) als Eckpfeiler ihrer neuen Leaf-Spine-Architektur ein. Jeder Compute-Rack erhielt einen Switch auf Basis des MQM8790-HS2F – der Siliziumplattform, auf der der 920-9B110-00FH-0D0 MQM8790-HS2F 200 Gbit/s HDR basiert – und bot damit 40 Ports mit 200 Gbit/s Konnektivität zu GPU-Servern über OSFP-zu-OSFP-Direct-Attach-Kabel. Auf der Spine-Ebene verbanden vier zusätzliche 920-9B110-00FH-0D0-Switches alle Leaf-Switches und schufen so ein nicht blockierendes Fat-Tree-Fabric mit voller Bisektionsbandbreite.

Besonders effektiv bei dieser Bereitstellung war die integrierte SHARPv2 (Scalable Hierarchical Aggregation and Reduction Protocol)-Technologie des Switches, die kollektive Kommunikationsoperationen direkt auf das Fabric auslagerte. In der Praxis bedeutete dies, dass All-Reduce-Operationen, die zuvor erhebliche Host-CPU-Zyklen und Netzwerkbandbreite verbrauchten, nun in einem einzigen Durchlauf über das Fabric abgeschlossen wurden – was die Job-Abschlusszeiten drastisch reduzierte.

Laut dem 920-9B110-00FH-0D0 Datenblatt liefert der Switch eine Cut-Through-Latenz von unter 200 ns, was den Leistungsanforderungen des Labors sehr nahe kam. Das Ingenieurteam bestätigte auch, dass das 920-9B110-00FH-0D0 kompatible Ökosystem alle Kabeltypen und Optiken umfasste, auf die sie bereits standardisiert hatten, wodurch kostspielige Neuverkabelungsarbeiten entfielen.

Ergebnisse & Messbare Gewinne: Vom Engpass zum Ermöglicher

Nach der Bereitstellung maß das Labor Verbesserungen in mehreren kritischen Dimensionen:

  • Reduzierung der Job-Abschlusszeit: Trainingsiterationen für ein Modell mit 13 Milliarden Parametern reduzierten sich um 35 %, wobei die All-Reduce-Latenz für typische Kollektivgrößen von 12 μs auf unter 5 μs sank.
  • Netzauslastung: Die durchschnittliche Fabric-Auslastung stieg von 58 % auf 83 %, ohne dass es zu Überlastungen kam, dank der adaptiven Routing- und Staukontrollmechanismen des Switches.
  • Energie- und Kühlluft-Effizienz: Im Vergleich zum vorherigen EDR-Fabric reduzierte die neue HDR-Infrastruktur den Stromverbrauch pro Port um 30 %, was es dem Labor ermöglichte, mehr Rechenknoten hinzuzufügen, ohne ihr Rechenzentrums-Strombudget zu überschreiten.

Aus Sicht der Gesamtbetriebskosten war der 920-9B110-00FH-0D0 Preis pro Port deutlich niedriger als bei NDR-Alternativen, was es dem Labor ermöglichte, sein gesamtes Fabric innerhalb seines bestehenden Budgets zu aktualisieren. Die 920-9B110-00FH-0D0 Spezifikationen hoben auch die redundanten Netzteile und hot-swap-fähigen Lüftermodule des Switches hervor, die zum Ziel des Labors von 99,999 % Verfügbarkeit für seine Produktions-Trainingsjobs beitrugen.

Netzwerkingenieure stellten fest, dass die 920-9B110-00FH-0D0 InfiniBand Switch OPN-Lösung nahtlos mit dem Unified Fabric Manager (UFM) von NVIDIA integriert war und eine zentrale Sichtbarkeit des Fabric-Zustands und automatisierte Benachrichtigungen bot. Dies reduzierte die Zeit für die Fehlerbehebung und proaktive Wartung erheblich und gab dem Team mehr Zeit, sich auf die Optimierung seiner Trainingspipelines zu konzentrieren, anstatt das Netzwerk zu verwalten.

Zusammenfassung & Ausblick: Die richtig dimensionierte HDR-Grundlage

Der NVIDIA Mellanox 920-9B110-00FH-0D0 erwies sich als die richtige Wahl für dieses Forschungslabor und lieferte die Leistung von 200 Gbit/s HDR zu einer Kostenstruktur, die wirtschaftlich sinnvoll war. Durch die Nutzung der 40-Port-Dichte, der In-Network-Computing-Fähigkeiten und der robusten Verwaltungsfunktionen des Switches verwandelte das Labor sein Netzwerk von einem Leistungsengpass in eine skalierbare Grundlage für zukünftiges Wachstum.

Für die Zukunft plant das Labor, seinen Cluster in den nächsten 18 Monaten auf 1.024 Knoten zu skalieren. Mit der Unterstützung des 920-9B110-00FH-0D0 für größere Topologien durch mehrere Spine-Ebenen hat es die Zuversicht, dass sein Netzwerk mit seiner Rechenkapazität wachsen kann. Für Organisationen, die ihre HDR-Infrastrukturoptionen bewerten, bietet der 920-9B110-00FH-0D0 zum Verkauf über die Channel-Partner von NVIDIA eine überzeugende, produktionsvalidierte Lösung, die Leistung, Dichte und Kosten ausbalanciert.