NVIDIA Mellanox MCX631432AN-ADAB in Aktion: RDMA/RoCE-Transport mit geringer Latenz und Server-Durchsatzoptimierung
July 28, 2026
NVIDIA Mellanox MCX631432AN-ADAB in Aktion: RDMA/RoCE Low-Latency Transport und Serverdurchsatzoptimierung
Hintergrund und Herausforderungen: Der Engpass im Netzwerk eines KI-Schulungsclusters
Ein führendes Fintech-Unternehmen hat kürzlich einen 64-Knoten-GPU-basierten KI-Cluster eingesetzt, der für Hochfrequenz-Handelsstrategie-Training entwickelt wurde, wobei jeder Server mit Hochleistungs-NVMe-Speicher ausgestattet ist.,Nach der Einführung lag der tatsächliche Ausbildungsdurchsatz deutlich unter den Erwartungen.Nach der Bereitstellung ergab die Analyse, dass die 10GbE-basierte TCP/IP-Verbindung zwischen Knoten die wichtigste Engpässe darstellt.All-Reduce-Kommunikationsoperationen zeigten eine Latenzzeit von bis zu 4 ̊5 Millisekunden.Während der CPU-Overhead für die Netzwerkprotokollverarbeitung 40% überschritt Das Team brauchte dringend eine Netzwerklösung, die sowohl die Kommunikationslatenz drastisch reduzieren als auch die CPU-Rechenkapazität zurückgewinnen könnte.
Lösung und Bereitstellung: Aufbau eines verlustfreien RoCE-Netzwerks mit dem MCX631432AN-ADAB
Nach einer umfassenden technischen Bewertung hat das Team dieNVIDIA Mellanox MCX631432AN-ADABSie wurden mit einem neuen Netzwerk ausgestattet.MCX631432AN-ADAB ConnectX-6 Lx mit zwei Anschlüssen 25GbE SFP28Adapter mit beiden SFP28-Anschlüssen, die an redundante NVIDIA Spectrum-3-Switches angeschlossen sind, um eine hochverfügbare Architektur herzustellen.
Der Einsatz erfolgte in drei verschiedenen Phasen:
- Phase 1 Pilotprojekt (8 Knotenpunkte):Das Team hat dieMCX631432AN-ADAB Ethernet-Adapterkarteauf einer Teilmenge von GPU-Servern, wobei RoCEv2 mit Priority Flow Control (PFC) und Explicit Congestion Notification (ECN) konfiguriert wird, um eine verlustfreie Ethernet-Fabrik zu erstellen.NCCL (NVIDIA Collective Communications Library) wurde mit RDMA-Unterstützung neu kompiliert.
- Phase 2 Tuning und Validierung:Mit Hilfe der Telemetrie-Daten, die imDatenblatt MCX631432AN-ADAB, das Team fein abgestimmt DCB-Parameter und Pufferschwellen, um PFC-Pause-Storms zu beseitigen, während fast Null Paketverlust aufrechterhalten.Spezifikationen für MCX631432AN-ADAB- die Optimierung der Unterbrechungsmoderation und der Warteschlange für das spezifische Arbeitsaufwandprofil.
- Phase 3 - Vollständige Produktion (64 Knotenpunkte):Nach erfolgreicher Validierung wurden die verbleibenden Knoten auf den neuen Adapter migriert.MCX631432AN-ADAB kompatibelTreiber, die nahtlos in die bestehende Ubuntu-basierte Umgebung und den Mellanox OFED-Stack integriert sind.
Das Team stellte fest, dassMCX631432AN-ADAB Ethernet-AdapterkartenlösungDie Anlagen lieferten einen einfachen Migrationsweg, da die Adapter vollständig mit ihrer vorhandenen SFP28-Kabel- und Schalterinfrastruktur kompatibel waren, was die Notwendigkeit kostspieliger Hilfsupgrades beseitigte.
Ergebnisse und Vorteile: Messbare Umwandlung der Latenz und des Durchsatzes
Die Leistungssteigerungen, die durchNVIDIA Mellanox MCX631432AN-ADABDie folgende Tabelle fasst die wichtigsten Kennzahlen vor und nach dem Upgrade zusammen:
| Metrische | Vor-Upgrade (10GbE TCP/IP) | Nach dem Upgrade (MCX631432AN-ADAB mit RoCE) | Verbesserungen |
|---|---|---|---|
| All-Reduce-Latency (durchschnittlich) | 4.7 ms | 0.32 ms | 14.7x Verringerung |
| Netzwerk-CPU-Nutzung (pro Knoten) | 42 Prozent | 9% | 33 pp freigesetzt |
| GPU-Auslastung (Datenladephase) | 61% | 89% | +28% |
| Cluster-Trainingsleistung | 1.8x Ausgangswert | 4.3x Ausgangswert | 2.4x erhöht |
Neben diesen quantitativen Gewinnen beobachtete das Team operative Verbesserungen, die die Produktivität der Entwickler direkt beeinflussten.Vorbildliche Trainings, die bisher 36 Stunden dauerten, in nur 15 Stunden abgeschlossenDie Hardware-basierte NVMe-oF-Offload reduzierte auch die Speicherzugriffslatenz um 35%, was die datenintensiven Checkpoint-Operationen weiter beschleunigte.Für Organisationen, die den Geschäftsfall bewerten, dieMCX631432AN-ADAB PreisDas Team stellte außerdem fest, dass die Datenverarbeitung in den letzten zehn Jahren sehr wettbewerbsfähig war, gemessen an der 2,4-fachen Durchsatzsteigerung und der Fähigkeit, zusätzliche GPU-Server-Akquisitionen aufzuschieben.MCX631432AN-ADAB zum VerkaufNVIDIA Spectrum-Switches bieten den kostengünstigsten Weg für zukünftige Skalierung.
Zusammenfassung und Aussichten: Eine Grundlage für künftige Arbeitsbelastungsinnovationen
Diese Produktion zeigt, daß dieNVIDIA Mellanox MCX631432AN-ADABist weit mehr als eine routinemäßige Netzwerk-Aktualisierung ∙ es ist ein transformatives Infrastrukturelement, das das volle Potenzial des modernen GPU-beschleunigten Computers freisetzt.Die Kombination von 50 Gb/s Gesamtbandbreite, sub-0.4ms kollektive Kommunikationslatenz, und dramatische CPU-Ablast-Fähigkeiten positioniert diesen Adapter als ideale Wahl für Organisationen, die verteilte KI, HPC,und Echtzeit-Analytik-Workloads.
Im Hinblick auf die Zukunft untersucht das Fintech-Team die Integration mit NVIDIA DOCA, um die Programmierbarkeit von Datenpfaden weiter zu beschleunigen und eine Null-Touch-Provisioning für zukünftige Cluster-Erweiterungen zu implementieren.Sie bewerten außerdem die Telemetriefähigkeiten des AdaptersDatenblatt MCX631432AN-ADAB¢ die Entwicklung prädiktiver Modelle für das Verkehrsüberlastungsmanagement.MCX631432AN-ADAB Ethernet-AdapterkartenlösungDas Unternehmen plant, für alle zukünftigen Infrastrukturinvestitionen auf dieser Plattform zu standardisieren.Vertrauen darauf, dass es eine solide und skalierbare Grundlage für die nächste Generation KI-basierter Finanzanwendungen bietet.

