NVIDIA Mellanox MQM8790-HS2F InfiniBand-Switch-Technisches Weißbuch

August 21, 2026

NVIDIA Mellanox MQM8790-HS2F InfiniBand-Switch-Technisches Weißbuch

NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch Technisches Weißbuch: Optimierung der Low-Latency-Verbindung für RDMA/HPC/AI-Cluster

Dieses technische Whitepaper richtet sich an Netzwerkarchitekten, Pre-Sales-Ingenieure und Betriebsleiter.NVIDIA Mellanox MQM8790-HS2FHDR-InfiniBand-Switch mit einer Geschwindigkeit von 200 Gb/s, der eine umfassende Lösung für die Optimierung von Interconnects mit geringer Latenzzeit im RDMA-beschleunigten Hochleistungsrechner (HPC) bietet,und Künstliche Intelligenz (KI) -ClusterDas Dokument behandelt Architekturentwurf, Schlüsseltechnologien, Bereitstellungs- und Skalierungsstrategien, Betriebsüberwachung,und Wertschätzung eine reproduzierbare Blaupause für eine datenintensive Recheninfrastruktur der nächsten Generation bieten.

1. Projekthintergrund und Bedarfsanalyse

Da die Parameter der KI-Modelle Milliardengrößen erreichen und HPC-Simulationen eine immer feinere Auflösung erfordern,Das zugrunde liegende Netzwerkgewebe hat sich von einer unterstützenden Komponente zu einem primären Leistungsdeterminanten entwickeltIn einem solchen Fall ist es nicht möglich, die Funktionsfähigkeit der Netzwerke zu verbessern, da die Funktionsfähigkeit der Netzwerke in der Regel nicht durch die Funktionsfähigkeit der Netzwerke selbst bestimmt wird.Für IT-Teams von Unternehmen, was sich direkt in längere Markteinführungszeiten für KI-Initiativen und unternutzte GPU-Investitionen übersetzt.

Zu den wichtigsten Anforderungen, die durch umfangreiche Kundenbeziehungen ermittelt wurden, gehören:

  • Ultra-niedrige und vorhersehbare Latenzzeit:Sub-200ns Durchschnittsschalter für MPI- und RDMA-Verkehr, mit minimalem Jitter.
  • Nicht blockierende Durchsatzleistung:Nachhaltige Leistung der Linienfrequenz in allen Häfen gleichzeitig, wodurch die Bildung von Hotspots und die Verschlechterung der Schwanzlatenz vermieden werden.
  • Berechnung im Netzwerk:Hardwarebeschleunigung für kollektive Vorgänge (All-Reduce, Broadcast, Barrier) zur Entlastung von Host-CPUs und zur Verringerung der Datenbewegung.
  • Unterstützung von skalierbaren Topologien:Fähigkeit, Fat-Tree-, Torus- oder Libelle+-Topologien zu erstellen, die Hunderte bis Tausende von Knoten ohne übermäßige Schaltlager umfassen.
  • Vereinfachte Verwaltung:Einheitliche Stoffüberwachung, automatisierte Topologie-Entdeckung und proaktive Fehlererkennung zur Verringerung der Betriebskosten.

DieMQM8790-HS2FDie Entwicklung dieser Architektur wurde mit der vorläufigenDatenblatt MQM8790-HS2FBestätigung von 40 Ports von 200 Gb/s HDR, Unter-130ns Durchschnittsverzögerung und Unterstützung von SHARP v3.0 In-Network-Computing-Fähigkeiten, die direkt an die oben genannten Anforderungen angepasst werden.

2. Gesamter Netzwerk- / Systemarchitekturentwurf

Die vorgeschlagene Architektur verwendet eine zweistufige Topologie für Cluster mit bis zu 1.200 Knoten, mit der Option, für größere Bereitstellungen auf drei Stufen zu erweitern.Diese Topologie balanciert die Leistung, Kosten und Handhabbarkeit, die eine volle Bisection-Bandbreite und eine deterministische Latenzzeit im gesamten Gewebe bieten.

Stufe Gerätetypen Anzahl der Häfen (verwendet) Rolle der Vernetzung
Blätter MQM8790-HS2F 32 x 200 Gb/s (16 für Knoten, 16 für Spines) Aggregate berechnen den Knotenverkehr
Rückenwirbel MQM8790-HS2F 40 x 200 Gb/s (alle auf Blattschalter) Nicht blockierende Kreuzverbindung zwischen Blättern

Jeder Leaf-Switch verbindet bis zu 16 Rechenknoten über NVIDIA ConnectX-6 oder ConnectX-7 HDR-Host-Kanaladapter.MQM8790-HS2F kompatibelDas System umfasst sowohl aktive optische Kabel (AOC) als auch passive Kupfer-DACs, je nach Verbindungsdistanz.MQM8790-HS2F 200Gb/s HDR 40-Port QSFP56Das Design bietet eine ausreichende Dichte für die Aggregation auf Rackebene, wobei ein 1U-Formfaktor für eine effiziente Nutzung des Rackraums beibehalten wird.

Für Cluster mit mehr als 1.200 Knoten wird eine dreistufige Topologie mit einer zusätzlichen Super-Spin-Schicht empfohlen.MQM8790-HS2F InfiniBand-SchalterlösungBeibehalten seine Rolle auf allen Ebenen und vereinfachen das Spar- und Konfigurationsmanagement.

3. Rolle und Hauptmerkmale des NVIDIA Mellanox MQM8790-HS2F

DieNVIDIA Mellanox MQM8790-HS2Fdient als grundlegendes Schaltelement in dieser Architektur und bietet folgende differenzierende Funktionen, die die Optimierung von Interconnects mit geringer Latenz direkt vorantreiben:

  • HDR 200 Gb/s Portgeschwindigkeit:Verdoppelt die Bandbreite von EDR (100 Gb/s) der vorherigen Generation und gewährleistet gleichzeitig eine Rückwärtskompatibilität mit HDR100 (100 Gb/s) für gemischte Geschwindigkeitsumgebungen und schützt so frühere Investitionen.
  • Durchschnittsschalter mit Unter-130ns Latenzzeit:Minimiert die Zeit, die Pakete innerhalb des Switches verbringen, was für latenzempfindliche RDMA-Operationen und kollektive Kommunikationsmuster von entscheidender Bedeutung ist.
  • SHARP v3.0 Netzwerkrechner:Entlastet Reduktionsvorgänge von Host-CPUs auf den Switch-Fabrik, reduziert den Datenverkehr um bis zu 30% und beschleunigt die All-Reducing-Leistung für das KI-Training um bis zu 2x.
  • Adaptive Routing- und Überlastungskontrolle:Verteilung des Verkehrs auf mehrere Wege, um Hotspots zu vermeiden, mit Überlastungsanzeigen und kreditbasierter Strömungssteuerung, die einen verlustfreien Betrieb gewährleisten.
  • Integrierte Telemetrie und Diagnose:Bietet eine detaillierte Sichtbarkeit der Bufferbesetzung pro Port, der Fehlerquote der Verbindungen und der Verkehrsmuster, was eine proaktive Optimierung und eine schnelle Fehlerisolation ermöglicht.

Nach den detailliertenSpezifikationen MQM8790-HS2F, unterstützt der Schalter sowohl Vorwärts- als auch Rückwärtsluftstromvarianten und bietet Platz für verschiedene Kühlkonstruktionen für Rechenzentren.Die doppelten, redundanten Stromversorgungen und die warmwechselbaren Lüftermodule erhöhen die Zuverlässigkeit und Servicefähigkeit.

4. Empfehlungen für die Bereitstellung und Erweiterung (mit typischer Topologie)

Für einen ausgewogenen und kostengünstigen ersten Einsatz werden folgende bewährte Verfahren empfohlen:

  • Verbindungen zwischen Knoten und Blättern:Die Verwendung von HDR-Kabeln von 200 Gb/s (Kupfer-DAC für ≤3 m, AOC für ≤30 m) mitMQM8790-HS2F kompatibelStellen Sie sicher, dass die Host-Kanal-Adapter für die gleiche Verbindungsgeschwindigkeit und FEC-Einstellungen wie die Switch-Ports konfiguriert sind.
  • Verbindungen von Blatt zu Wirbelsäule:Die Einführung von 200Gb/s AOCs oder multimodalen Glasfasertransceivern für Entfernungen von bis zu 100 m.MQM8790-HS2FSie verhandelt automatisch die Linkparameter und vereinfacht die Bereitstellung.
  • Überabonnementplanung:Für allgemein genutzte KI/HPC-Workloads bietet ein 2:1-Oversubscription-Verhältnis (zwei Rechenknoten pro 200Gb/s Uplink) einen kostengünstigen Wert.Erwägung 11 (vollständige) Überbuchung.
  • Erweiterungspfad:Wenn neue Racks hinzugefügt werden, müssen einfach zusätzliche Blattschalter eingesetzt und an die vorhandenen Rückgratschalter angeschlossen werden.die Wirbelsäulenschicht auf eine höhere Wurzel erhöhen oder eine Superwirbelsäulenschicht hinzufügen.

Bei der Bewertung derMQM8790-HS2F Preisund Gesamtbetriebskosten,Die Einheitliche Architektur – die Verwendung desselben Schalttyps für alle Stoffstufen – reduziert den Ersatzteilbestand um etwa 70% im Vergleich zu Multi-SKU-Ansätzen.Diese Vereinfachung beschleunigt die Reaktion auf Vorfälle und minimiert Ausfallzeiten bei Hardwarefehlern.

5. Betriebsüberwachung, Fehlerbehebung und Optimierung

Wirksames Management vonMQM8790-HS2F InfiniBand-SchalterDie Umwelt erfordert einen systematischen Ansatz bei der Überwachung, Diagnose und Leistungsausrichtung.

Überwachung bewährter Verfahren:

  • Implementieren Sie den Unified Fabric Manager (UFM) von NVIDIA für eine zentralisierte Fabric-Sichtbarkeit, einschließlich Topologie-Karten, Per-Link-Utilization-Heatmaps und Echtzeit-Latenz-Histogramme.
  • Überwachen Sie die Fehlerzähler pro Port - insbesondere CRC-Fehler, Symbolfehler und Verknüpfungsereignisse - um schädliche Optik oder Kabel frühzeitig zu erkennen.SNMP-Fallen für vordefinierte Schwellenwerte festlegen, um eine proaktive Wartung zu ermöglichen.
  • Über die integrierten Leistungszähler des Schalters wird die Effizienz des kollektiven Betriebs von SHARP verfolgt und Möglichkeiten zur Optimierung der kollektiven Kommunikationsmuster auf Anwendungsebene ermittelt.

Fehlerbehebung häufiger Probleme:

  • Verknüpfung von CRC-Fehlern an bestimmten Ports:Überprüfen Sie, ob das Kabel sitzt und ob die optischen Steckverbinder sauber sind.Datenblatt MQM8790-HS2Fenthält detaillierte diagnostische Schwellenwerte pro Hafen.
  • Unerwartete Latenzspitzen:Überprüfen Sie die Überlastungshotspots anhand der UFM-Verkehrsflussanalyse. Adaptive Routing kann für bestimmte Verkehrsmuster neu konfiguriert werden müssennicht-minimal).
  • Probleme mit der Stoffpartition:Sicherstellen Sie die richtigen Partitionsschlüssel (PKey) und IPoIB-Subnetzmanager-Konfigurationen.aber manuelle Anpassungen können für mehrere Mieter erforderlich sein.

Tipps zur Leistungsoptimierung:

  • Für KI-Trainings-Workloads aktivieren Sie SHARP v3.0 und konfigurieren Sie kollektive Kommunikationsbibliotheken (NCCL, OpenMPI), um die Offload-Fähigkeiten des Switches zu nutzen.Dies kann die Verzögerungszeit für große Nachrichtengrößen um bis zu 2x reduzieren.
  • Für latenzempfindliche HPC-Anwendungen sollten Sie adaptive Routing deaktivieren, um die deterministische Pfadwahl durchzusetzen und eine gewisse Pfadvielfalt für eine vorhersehbare Latenz zu tauschen.
  • Überprüfen und aktualisieren Sie regelmäßig die Switch-Firmware, da NVIDIA regelmäßig Leistungsverbesserungen und Sicherheitspatches veröffentlicht.Datenblatt MQM8790-HS2Ffür Versionskompatibilitätsmatrizen.

6Zusammenfassung und Bewertung

DieNVIDIA Mellanox MQM8790-HS2Fbietet eine überzeugende Wertschöpfung für Organisationen, die RDMA/HPC/AI-Cluster erstellen oder aktualisieren.und die Beschleunigung des Netzwerkrechners innerhalb einer 1UDer Schalter, der mit einem 40-Port-Chassis ausgestattet ist, erfüllt die strengsten Anforderungen an die Vernetzung moderner datenintensiver Arbeitslasten.

Zu den wichtigsten Wertschöpfungstreibern gehören:

  • Skalierbarkeit der Leistung:Die nicht blockierende Fat-Tree-ArchitekturMQM8790-HS2F 200Gb/s HDR 40-Port QSFP56Knoten skalieren von 200 auf mehr als 10.000 Knoten ohne grundlegende Topologieänderungen.
  • Betriebseffizienz:Ein einziger Schaltertyp für alle Stoffstufen reduziert das Ersatzteilbestand, vereinfacht das Training und beschleunigt die Fehlerbehebung.
  • Investitionsschutz:Die Rückwärtskompatibilität mit HDR100 und EDR ermöglicht schrittweise Upgrades, während sich der Formfaktor und die Portdichte des Switches mit zukünftigen 400G-Roadmaps (NDR) ausrichten.
  • Bewährtes Ökosystem:Die tiefe Integration mit den ConnectX-Adaptern, den BlueField-DPUs und der UFM-Managementplattform von NVIDIA gewährleistet eine durchgängige Leistungsvorhersagbarkeit.

Für Organisationen, die bereit sind, dieMQM8790-HS2F zum VerkaufDas NVIDIA-Netzwerk umfasst umfassende Support-Optionen, einschließlich Vor-Ort-Ersatzteile, erweiterter Ersatz und Firmware-Update-Abonnements.Spezifikationen MQM8790-HS2FNVIDIA bietet eine Reihe von Dienstleistungen an, die sich auf die Bereitstellung technischer Dokumentationen auswirken.