Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch Technische Lösung
July 15, 2026
Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch Technische Lösung | Verbindungsoptimierung mit geringer Latenz für RDMA/HPC/AI-Cluster
1. Projekthintergrund und Anforderungsanalyse
Moderne KI-Trainings-Frameworks und HPC-Anwendungen werden zunehmend durch die Leistung der Netzwerkverbindung und nicht nur durch die Rechendichte allein eingeschränkt. Verteilte Trainingsjobs – insbesondere solche, die große Sprachmodelle verwenden – erzeugen massive, synchronisierte All-Reduction- und All-to-All-Verkehrsmuster, die herkömmliche Ethernet-Fabrics überfordern. Zu den wichtigsten Anforderungen, die bei Unternehmensbereitstellungen ermittelt wurden, gehören: Switch-Latenz von weniger als einer Mikrosekunde zur Minimierung des Kommunikations-Overheads, nicht blockierender Durchsatz in großem Maßstab zur Vermeidung von Überbuchungen, erweiterte Überlastungskontrolle zur Bewältigung von Incast-Bursts und nahtlose Integration mit RDMA over Converged Ethernet (RoCE) oder nativen InfiniBand-Ökosystemen. Darüber hinaus benötigen Betriebsteams umfassende Telemetrie zur proaktiven Fehlererkennung und vereinfachten Verwaltung über Hunderte von Ports hinweg.
2. Gesamtentwurf der Netzwerk-/Systemarchitektur
Die vorgeschlagene Architektur basiert auf einer zweistufigen Leaf-Spine-Topologie, die speziell für GPU-zentrierte Arbeitslasten entwickelt wurde. Auf der Blattschicht beherbergt jedes Gestell dasMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0Als primärer ToR-Switch (Top-of-Rack) verbindet er bis zu 40 Rechenknoten über 400-Gbit/s-NDR-Links. Die Wirbelsäulenschicht besteht aus einer zweiten Schicht920-9B210-00FN-0D0 MQM9790-NS2F 400 Gbit/s NDRSwitches, die Full-Mesh-Konnektivität mit 4:1-Überbuchung bieten – oder völlig blockierungsfrei, wenn sie mit ausreichend Spine-Ports bereitgestellt werden. Dieses Design unterstützt bis zu 512 GPU-Knoten in einer einzigen Fabric-Domäne mit der Option zur horizontalen Skalierung über mehrere Subnetze, die über NVIDIAs UFM (Unified Fabric Manager) miteinander verbunden sind.
Die Architektur nutzt die netzwerkinterne Computing-Engine SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) von NVIDIA und verlagert kollektive Vorgänge direkt auf den Switch-ASIC. Dies reduziert das Datenvolumen, das die CPU-/GPU-Speicherbusse durchquert, und verringert die Latenz der kollektiven Vorgänge im Vergleich zu softwarebasierten Ansätzen um bis zu 40 %. Der920-9B210-00FN-0D0 InfiniBand-Switch OPNUnterstützt außerdem adaptives Routing, das dynamisch den am wenigsten überlasteten Pfad für jedes Paket auswählt und so eine optimale Bandbreitennutzung auch bei asymmetrischer Verkehrslast gewährleistet.
3. Rolle und Hauptmerkmale des 920-9B210-00FN-0D0 in der Lösung
DerNVIDIA Mellanox 920-9B210-00FN-0D0dient als Grundbaustein für die gesamte Verbindungsstruktur. Zu seinen Hauptaufgaben gehören:
- Aggregation mit hoher Dichte:Mit bis zu 64 nicht blockierenden 400-Gbit/s-Ports in einem 2U-Formfaktor liefert der Switch eine Gesamtschaltkapazität von 25,6 Tbit/s. Diese Dichte reduziert die Anzahl der pro Rack benötigten Switches, vereinfacht die Verkabelung und senkt den Stromverbrauch pro Port.
- Switching mit extrem geringer Latenz:Der Switch hält eine Latenz von unter 600 ns für jede Paketgröße aufrecht, was für Anwendungen, die empfindlich auf Tail-Latenz reagieren, wie Online-Inferenz und Finanz-HPC, von entscheidender Bedeutung ist.
- In-Network-Computing:Die SHARPv3-Integration ermöglicht eine Hardwarebeschleunigung kollektiver Vorgänge, reduziert die Anzahl der Durchläufe in der Fabric und verbessert die Gesamtzeit für die Auftragserledigung um bis zu 30 %.
- Erweiterte Telemetrie und Staukontrolle:Der Switch bietet Transparenz pro Flow, markiert überlastete Streams für hostseitige Anpassungen und ermöglicht eine frühzeitige Warnung vor beginnenden Hotspots.
Laut der920-9B210-00FN-0D0 DatenblattDer Switch unterstützt sowohl Kupfer- als auch optische QSFP-DD-Transceiver920-9B210-00FN-0D0 kompatibelmit der vorhandenen Verkabelungsinfrastruktur in den meisten Rechenzentren. Der Luftstrom von vorne nach hinten und die redundanten Netzteile sorgen für hohe Verfügbarkeit in Unternehmensumgebungen.
4. Bereitstellungs- und Skalierungsempfehlungen (typische Topologie)
Für eine Greenfield-Bereitstellung von 128 GPU-Knoten empfehlen wir eine zweistufige Architektur mit 4 Leaf-Switches und 2 Spine-Switches, wobei jeder Spine über 4x400-Gbit/s-Uplinks mit jedem Leaf verbunden ist – was zu einem Überbuchungsverhältnis von 2:1 führt, was für die meisten Trainings-Workloads akzeptabel ist. Für latenzempfindliche Anwendungen oder Anwendungen mit hoher Bandbreite kann ein nicht blockierendes 1:1-Design erreicht werden, indem die Spine-Anzahl auf 4 erhöht wird, was zu einer Gesamt-Uplink-Kapazität führt, die der der Downlink-Ports entspricht.
Eine Skalierung über 512 Knoten hinaus erfordert die Partitionierung der Fabric in mehrere Subnetze, die jeweils von UFM als eigene Fabric-Insel verwaltet werden. Die Kommunikation zwischen Subnetzen kann über die Quantum-2-Gateways von NVIDIA oder über hostbasiertes Routing geleitet werden. Der empfohlene Ansatz für leistungsempfindliche Arbeitslasten besteht jedoch darin, die Fabric nach Möglichkeit innerhalb eines einzelnen Subnetzes zu belassen. Der920-9B210-00FN-0D0 Spezifikationenunterstützen diese großen Topologien mit integrierter Flusskontrolle und prioritätsbasierter Flusskontrolle (PFC), um Paketverluste bei Pfadumleitungsereignissen zu verhindern.
Erwägen Sie bei der Planung der physischen Verkabelung die Verwendung von MPO-zu-QSFP-DD-Breakout-Kabeln für Spine-Leaf-Verbindungen, um die Kabeldichte zu reduzieren, oder von aktiven optischen Kabeln (AOCs) für Entfernungen über 3 Meter. Der920-9B210-00FN-0D0 zu verkaufenEnthält normalerweise ein umfassendes Zubehörset. Wir empfehlen jedoch, die Kompatibilität von Transceivern von Drittanbietern anhand der Interoperabilitätsmatrix des Anbieters zu überprüfen, um Probleme beim Link-Training zu vermeiden.
5. Betrieb, Überwachung und Fehlerdiagnose
Operative Exzellenz ist ein Eckpfeiler der920-9B210-00FN-0D0 InfiniBand-Switch OPN-Lösung. Der Switch lässt sich nahtlos in die UFM-Plattform von NVIDIA integrieren, die Folgendes bietet:
- Echtzeit-Überwachung des Fabric-Zustands:Dashboards für Verbindungsstatus, Temperatur, Stromverbrauch und Fehlerzähler pro Port (CRC-, Symbol- und Ausrichtungsfehler).
- Vorausschauende Fehleranalyse:Modelle für maschinelles Lernen auf UFM identifizieren proaktiv fehlerhafte Optiken oder sich verschlechternde Verbindungen, bevor sie zu Auftragsausfällen führen.
- Automatisierte Fehlerbehebung:Das System empfiehlt Korrekturmaßnahmen, wie z. B. die Umleitung des Datenverkehrs oder die Isolierung fehlerhafter Links, wodurch die mittlere Zeit bis zur Lösung (MTTR) erheblich verkürzt wird.
Für erweiterte Diagnosen unterstützt der Switch sFlow und Port-Spiegelung und ermöglicht so eine umfassende Paketinspektion für das Debuggen auf Protokollebene. Teams können auch detailliert darauf zugreifen920-9B210-00FN-0D0 Spezifikationenfür Pufferschwellenwerte und empfohlene Einstellungen, insbesondere zur Optimierung des RoCEv2-Verkehrs bei Verwendung in gemischten InfiniBand/Ethernet-Umgebungen. Die Leistungsoptimierung sollte sich auf adaptive Routing-Schwellenwerte und SHARPv3-Aggregationsintervalle konzentrieren, die pro Workload-Phase angepasst werden können – zum Beispiel Training versus Inferenz.
Zu den routinemäßigen Wartungsarbeiten gehören Firmware-Updates, die mithilfe der fortlaufenden Upgrade-Funktion von UFM mit minimaler Unterbrechung durchgeführt werden, sowie die regelmäßige Reinigung optischer Anschlüsse zur Aufrechterhaltung der Signalintegrität. Die redundanten Strom- und Lüftermodule des Switches ermöglichen einen Hot-Swap-Austausch während des Betriebs.
6. Zusammenfassung und Wertbewertung
DerMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0bietet eine umfassende Lösung für Unternehmen, die die volle Leistung ihrer KI- und HPC-Investitionen ausschöpfen möchten. Durch die Kombination von NDR-Geschwindigkeiten von 400 Gbit/s, In-Network-Computing und intelligentem Überlastungsmanagement in einer einzigen, skalierbaren Plattform werden die dringendsten Verbindungsherausforderungen angegangen, mit denen heutige Rechenzentren konfrontiert sind. Die beschriebene Architektur bietet einen bewährten Weg von Pilotclustern mit 128 Knoten zu Supercomputing-Fabrics mit mehr als 2.000 Knoten, mit Betriebstools, die die Verwaltung vereinfachen und die Gesamtbetriebskosten senken.
Bei der Bewertung der920-9B210-00FN-0D0 PreisBerücksichtigen Sie den langfristigen Wert: Verkürzte Auftragsabwicklungszeiten führen direkt zu niedrigeren Cloud-Kosten oder einer schnelleren Erkenntnisgewinnung für lokale Arbeitslasten. Der920-9B210-00FN-0D0 InfiniBand-Switch OPN-Lösungwird durch das globale Support-Netzwerk und das umfangreiche Partner-Ökosystem von NVIDIA unterstützt und stellt sicher, dass Unternehmen ihre Infrastruktur auch in den kommenden Jahren zuverlässig bereitstellen, skalieren und optimieren können.
Für eine detaillierte Planung wenden Sie sich bitte an den Beamten920-9B210-00FN-0D0 DatenblattUnd920-9B210-00FN-0D0 SpezifikationenDokument, das mechanische Zeichnungen, thermische Profile und Leistungsbenchmarks enthält.

