Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch in der Praxis
July 15, 2026
Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch in der Praxis.
Hintergrund und Herausforderungen: Wenn sich die Cluster-Skala mit Engpässen der Vernetzung konfrontiert sieht
Die KI-Forschungsabteilung eines führenden Internetunternehmens befand sich an einer bekannten Kreuzung.Ihre wachsende Flotte von GPU-Servern, die sich über mehrere Racks erstreckt und zunehmend für die Ausbildung großer Sprachmodelle verwendet wird, leidet unter unvorhersehbaren Fertigstellungszeiten.Die bestehende Ethernet-basierte Struktur, die zwar für allgemeine Arbeitsbelastungen geeignet ist, konnte jedoch nicht mit den synchronisierten, rasanten Verkehrsmustern des verteilten Trainings umgehen.All-Reduced-Operationen würden regelmäßig aufgrund von Paketverlusten und Incaste-Überlastungen ausfallen.Das Infrastrukturteam brauchte eine grundlegende Veränderung in der Art und Weise, wie sein Backend-Netzwerk RDMA-Verkehr verwaltete.Und sie brauchten es, ohne ihre gesamte Rechenzentrumsarchitektur zu überarbeiten..
Lösungsdesign: Bereitstellung des 920-9B210-00FN-0D0 InfiniBand Switch OPN
Nach der Auswertung mehrerer Verbindungsoptionen wählte das Team dieMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0Die Einführung konzentrierte sich auf eine zweistufige Leaf-Spin-Topologie, wobei jeder Leaf-Switch bis zu 40 GPU-Knoten über 400Gb/s-Verbindungen verbindet.920-9B210-00FN-0D0 MQM9790-NS2F 400 Gbit/s NDRDiese Variante wurde speziell wegen ihrer nicht blockierenden Architektur und der integrierten SHARPv3-In-Network-Computing-Fähigkeiten ausgewählt.Dies erlaubte es dem Team, kollektive Kommunikationsoperationen direkt auf das Schaltergewebe zu verladen., wodurch der CPU-Overhead reduziert und GPU-Zyklen für die tatsächliche Berechnung freigegeben werden.
In Bezug auf den physischen Einsatz wurden die Schalter mit einer Front-to-Back-Luftströmung installiert, um der bestehenden Konfiguration von heißem/kaltem Gang zu entsprechen.Datenblatt 920-9B210-00FN-0D0Die Kabel wurden mit QSFP-DD-Transceivern konsistent gehalten, wobei die920-9B210-00FN-0D0 kompatibelOptik, die über das gesamte Verbindungsbudget validiert wurde, einschließlich der bis zu 100 Meter langen Rücken-zu-Blatt-Verbindungen.
Einsatzansatz: Schrittweise Integration
- Phase 1 Validierung im Labor:Eine kleine Testanlage mit 8 GPU-Knoten und zwei Switches wurde zur Benchmarking von Latenz und Durchsatz verwendet.NVIDIA Mellanox 920-9B210-00FN-0D0Nachweis einer Schaltverzögerung von unter 600 ns, eine Verbesserung von 60% gegenüber der vorherigen HDR-Generation.
- Phase 2 Stufenweise Einführung:Das Team migrierte jeweils eine Trainings-Kapsel und verwendete NVIDIAs Unified Fabric Manager, um die Link-Gesundheit und Staus in Echtzeit zu überwachen.Dies minimierte die Störung der laufenden Produktionsbelastungen.
- Phase 3 Vollständige Integration:Alle 18 Switches wurden über drei Racks verteilt und bildeten eine vollständig nicht blockierende Wirbelsäule mit 400Gb/s Uplinks.Adaptive Routing wurde ermöglicht, den Verkehr dynamisch auszugleichen und zu vermeiden, dass während der Spitzenzeiten überschüssige Stellen eingereicht werden.
Während des gesamten Einsatzes verwies das Ingenieurteam auf die umfassendeSpezifikationen 920-9B210-00FN-0D0Die fortschrittliche Telemetrie des Schalters lieferte einen detaillierten Überblick über die Fehlerzahlen pro Port und die Verknüpfungsauslastung.proaktive Wartung und Kapazitätsplanung ermöglichen.
Messbare Ergebnisse und Betriebsvorteile
Innerhalb von zwei Wochen nach der vollständigen Bereitstellung waren die Verbesserungen spürbar.Dies entspricht einer Verringerung der Kommunikationskosten um 37%.Die Arbeitszeit für ein typisches GPT-Modell verbesserte sich um fast 30%, wodurch das Forschungsteam schneller iterieren und mehr Experimente pro Woche durchführen konnte.Die integrierte SHARPv3-Engine entlastete durchschnittlich 18% der kollektiven Operationen, was sich direkt in eine höhere GPU-Auslastung und einen geringeren Energieverbrauch pro Trainingslauf übersetzt.
Im operativen Bereich berichtete das IT-Team von weniger netzwerkbezogenen Arbeitsfehlern und verbrachte deutlich weniger Zeit mit der Diagnose von Problemen auf Verbindungsebene.920-9B210-00FN-0D0 InfiniBand-Switch-OPN-LösungDie einheitliche Managementoberfläche reduzierte die Lernkurve für das Netzbetriebsteam.Wer könnte jetzt das gesamte Gewebe durch eine einzige Glaswand verwalten.
Kosten und Beschaffungsfragen
Während die ursprüngliche920-9B210-00FN-0D0 PreisDurch die Verringerung der Arbeitszeit und die Verbesserung der GPU-Auslastung, die dieDie Organisation erzielte eine Verringerung der Cloud-Instanzkosten um 22% für eine gleichwertige RechenleistungAußerdem ist die920-9B210-00FN-0D0 zum VerkaufDurch mehrere Kanalpartner konnten wettbewerbsfähige Angebote abgegeben werden, und die langfristige Unterstützung von NVIDIA Mellanox bot Vertrauen in die Investition.
Zusammenfassung und Ausblick: Ein Plan für die KI-Infrastruktur der nächsten Generation
Der Einsatz derMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0Die Kombination von 400Gb/s NDR-Geschwindigkeiten ermöglicht die Nutzung vonSubmikrosekunden-Latenzzeit, und in-network-computing-Fähigkeiten adressiert die Schmerzpunkte von RDMA-basierten HPC- und KI-Clustern.920-9B210-00FN-0D0 InfiniBand-Schalter OPNIn den meisten Fällen werden die Daten in verschiedenen Topologien verarbeitet, während sich die IT-Manager auf die robusten Management-Tools und die umfassendeDatenblatt 920-9B210-00FN-0D0für die Kapazitätsplanung.
Die Organisation plant bereits, die Struktur zu erweitern, um größere GPU-Cluster zu unterstützen.einschließlich der Integration von BlueField-3 DPUs für zusätzliche Speicherentlastung und Sicherheitsisolation. Die920-9B210-00FN-0D0 kompatibelDas Ökosystem sorgt dafür, dass zukünftige Upgrades, sei es auf neuere NICs oder optische Technologien, nahtlos unterstützt werden.Diese Umstellung stellt nicht nur ein inkrementelles Upgrade dar, sondern einen grundlegenden Erleichterungsschritt für die Leistung in großem Maßstab..

