NVIDIA Mellanox MCX631432AN-ADAB in Aktion: RDMA/RoCE-Transport mit geringer Latenz und Server-Durchsatzoptimierung

July 28, 2026

Neueste Unternehmensnachrichten über NVIDIA Mellanox MCX631432AN-ADAB in Aktion: RDMA/RoCE-Transport mit geringer Latenz und Server-Durchsatzoptimierung

NVIDIA Mellanox MCX631432AN-ADAB in Aktion: RDMA/RoCE Low-Latency Transport und Serverdurchsatzoptimierung

Hintergrund und Herausforderungen: Der Engpass im Netzwerk eines KI-Schulungsclusters

Ein führendes Fintech-Unternehmen hat kürzlich einen 64-Knoten-GPU-basierten KI-Cluster eingesetzt, der für Hochfrequenz-Handelsstrategie-Training entwickelt wurde, wobei jeder Server mit Hochleistungs-NVMe-Speicher ausgestattet ist.,Nach der Einführung lag der tatsächliche Ausbildungsdurchsatz deutlich unter den Erwartungen.Nach der Bereitstellung ergab die Analyse, dass die 10GbE-basierte TCP/IP-Verbindung zwischen Knoten die wichtigste Engpässe darstellt.All-Reduce-Kommunikationsoperationen zeigten eine Latenzzeit von bis zu 4 ̊5 Millisekunden.Während der CPU-Overhead für die Netzwerkprotokollverarbeitung 40% überschritt Das Team brauchte dringend eine Netzwerklösung, die sowohl die Kommunikationslatenz drastisch reduzieren als auch die CPU-Rechenkapazität zurückgewinnen könnte.

Lösung und Bereitstellung: Aufbau eines verlustfreien RoCE-Netzwerks mit dem MCX631432AN-ADAB

Nach einer umfassenden technischen Bewertung hat das Team dieNVIDIA Mellanox MCX631432AN-ADABSie wurden mit einem neuen Netzwerk ausgestattet.MCX631432AN-ADAB ConnectX-6 Lx mit zwei Anschlüssen 25GbE SFP28Adapter mit beiden SFP28-Anschlüssen, die an redundante NVIDIA Spectrum-3-Switches angeschlossen sind, um eine hochverfügbare Architektur herzustellen.

Der Einsatz erfolgte in drei verschiedenen Phasen:

  • Phase 1 Pilotprojekt (8 Knotenpunkte):Das Team hat dieMCX631432AN-ADAB Ethernet-Adapterkarteauf einer Teilmenge von GPU-Servern, wobei RoCEv2 mit Priority Flow Control (PFC) und Explicit Congestion Notification (ECN) konfiguriert wird, um eine verlustfreie Ethernet-Fabrik zu erstellen.NCCL (NVIDIA Collective Communications Library) wurde mit RDMA-Unterstützung neu kompiliert.
  • Phase 2 Tuning und Validierung:Mit Hilfe der Telemetrie-Daten, die imDatenblatt MCX631432AN-ADAB, das Team fein abgestimmt DCB-Parameter und Pufferschwellen, um PFC-Pause-Storms zu beseitigen, während fast Null Paketverlust aufrechterhalten.Spezifikationen für MCX631432AN-ADAB- die Optimierung der Unterbrechungsmoderation und der Warteschlange für das spezifische Arbeitsaufwandprofil.
  • Phase 3 - Vollständige Produktion (64 Knotenpunkte):Nach erfolgreicher Validierung wurden die verbleibenden Knoten auf den neuen Adapter migriert.MCX631432AN-ADAB kompatibelTreiber, die nahtlos in die bestehende Ubuntu-basierte Umgebung und den Mellanox OFED-Stack integriert sind.

Das Team stellte fest, dassMCX631432AN-ADAB Ethernet-AdapterkartenlösungDie Anlagen lieferten einen einfachen Migrationsweg, da die Adapter vollständig mit ihrer vorhandenen SFP28-Kabel- und Schalterinfrastruktur kompatibel waren, was die Notwendigkeit kostspieliger Hilfsupgrades beseitigte.

Ergebnisse und Vorteile: Messbare Umwandlung der Latenz und des Durchsatzes

Die Leistungssteigerungen, die durchNVIDIA Mellanox MCX631432AN-ADABDie folgende Tabelle fasst die wichtigsten Kennzahlen vor und nach dem Upgrade zusammen:

Metrische Vor-Upgrade (10GbE TCP/IP) Nach dem Upgrade (MCX631432AN-ADAB mit RoCE) Verbesserungen
All-Reduce-Latency (durchschnittlich) 4.7 ms 0.32 ms 14.7x Verringerung
Netzwerk-CPU-Nutzung (pro Knoten) 42 Prozent 9% 33 pp freigesetzt
GPU-Auslastung (Datenladephase) 61% 89% +28%
Cluster-Trainingsleistung 1.8x Ausgangswert 4.3x Ausgangswert 2.4x erhöht

Neben diesen quantitativen Gewinnen beobachtete das Team operative Verbesserungen, die die Produktivität der Entwickler direkt beeinflussten.Vorbildliche Trainings, die bisher 36 Stunden dauerten, in nur 15 Stunden abgeschlossenDie Hardware-basierte NVMe-oF-Offload reduzierte auch die Speicherzugriffslatenz um 35%, was die datenintensiven Checkpoint-Operationen weiter beschleunigte.Für Organisationen, die den Geschäftsfall bewerten, dieMCX631432AN-ADAB PreisDas Team stellte außerdem fest, dass die Datenverarbeitung in den letzten zehn Jahren sehr wettbewerbsfähig war, gemessen an der 2,4-fachen Durchsatzsteigerung und der Fähigkeit, zusätzliche GPU-Server-Akquisitionen aufzuschieben.MCX631432AN-ADAB zum VerkaufNVIDIA Spectrum-Switches bieten den kostengünstigsten Weg für zukünftige Skalierung.

Zusammenfassung und Aussichten: Eine Grundlage für künftige Arbeitsbelastungsinnovationen

Diese Produktion zeigt, daß dieNVIDIA Mellanox MCX631432AN-ADABist weit mehr als eine routinemäßige Netzwerk-Aktualisierung ∙ es ist ein transformatives Infrastrukturelement, das das volle Potenzial des modernen GPU-beschleunigten Computers freisetzt.Die Kombination von 50 Gb/s Gesamtbandbreite, sub-0.4ms kollektive Kommunikationslatenz, und dramatische CPU-Ablast-Fähigkeiten positioniert diesen Adapter als ideale Wahl für Organisationen, die verteilte KI, HPC,und Echtzeit-Analytik-Workloads.

Im Hinblick auf die Zukunft untersucht das Fintech-Team die Integration mit NVIDIA DOCA, um die Programmierbarkeit von Datenpfaden weiter zu beschleunigen und eine Null-Touch-Provisioning für zukünftige Cluster-Erweiterungen zu implementieren.Sie bewerten außerdem die Telemetriefähigkeiten des AdaptersDatenblatt MCX631432AN-ADAB¢ die Entwicklung prädiktiver Modelle für das Verkehrsüberlastungsmanagement.MCX631432AN-ADAB Ethernet-AdapterkartenlösungDas Unternehmen plant, für alle zukünftigen Infrastrukturinvestitionen auf dieser Plattform zu standardisieren.Vertrauen darauf, dass es eine solide und skalierbare Grundlage für die nächste Generation KI-basierter Finanzanwendungen bietet.