NVIDIA Mellanox MCX623106AN-CDAT Server-Adapter in Aktion | RDMA/RoCE Niedriglatenz-Transport & Server-Durchsatzsteigerungen
July 22, 2026
NVIDIA Mellanox MCX623106AN-CDAT Server Adapter in Aktion | RDMA/RoCE Low-Latency Transport & Server-Durchsatzsteigerungen
Hintergrund & Die Herausforderung: Wenn 200GbE auf die KI-Skalierungsmauer trifft
Eine schnell wachsende KI-Forschungsorganisation – nennen wir sie „DeepCore Labs“ – sah sich mit einem kritischen Skalierungsengpass konfrontiert. Ihr Flaggschiff-Cluster für das Training großer Sprachmodelle, bestehend aus 512 NVIDIA H100 GPUs, verteilt auf 128 Knoten, zeigte eine starke Leistungsverschlechterung, als sie über 64 Knoten hinaus skalierten. Das Problem lag nicht im Compute oder Speicher, sondern im Netzwerk-Fabric. All-Reduce-Synchronisationsgradienten dauerten über 15 Sekunden pro Iteration, und die GPU-Auslastung war aufgrund von Netzwerk-Stalls auf nur 62 % gesunken. Ihre bestehende 100GbE-Infrastruktur, die auf softwarebasiertem TCP/IP basierte, konnte die burstigen, latenzempfindlichen Kommunikationsmuster des verteilten Trainings einfach nicht bewältigen. Das Team benötigte eine Lösung, die einen Durchsatz von 200GbE bei Leitungsgeschwindigkeit mit deterministischer Latenz im Mikrosekundenbereich liefern konnte.
Ihre Evaluierung führte sie zumNVIDIA Mellanox MCX623106AN-CDAT– einem 200GbE-Serveradapter, der für die anspruchsvollsten KI- und HPC-Workloads entwickelt wurde. Das Forschungsteam erkannte, dass derMCX623106AN-CDAT ConnectX Adapter PCIe-Netzwerkkartedie fortschrittlichen Offloads und GPUDirect-Funktionen bot, die erforderlich waren, um den Netzwerkengpass zu beseitigen und die GPU-Auslastung zu maximieren.
Die Lösung: Bereitstellung des MCX623106AN-CDAT Ethernet-Adapterkarten
DeepCore Labs setzte dieMCX623106AN-CDAT Ethernet-Adapterkarteauf allen 128 Trainingsknoten ein, wobei jeder Server mit einem Dual-Port QSFP112-Adapter ausgestattet war, der an ein Leaf-Spine-Fabric angeschlossen war, das auf NVIDIA Spectrum-4-Switches basierte. Die Bereitstellung nutzte die native RoCE v2-Unterstützung des Adapters, um verlustfreien Ethernet-Transport zu ermöglichen und die Notwendigkeit eines separaten InfiniBand-Fabrics zu eliminieren. Entscheidend für die Lösung war die GPUDirect RDMA-Fähigkeit des Adapters, die eine direkte Datenübertragung zwischen GPUs über das Netzwerk ohne CPU-Intervention ermöglichte – eine kritische Funktion zur Reduzierung des Synchronisations-Overheads.
Das Team konfigurierte PFC (Priority Flow Control) und ECN (Explicit Congestion Notification) auf Switch-Ebene, wobei Priorität 3 für kollektive Kommunikationsdaten und Priorität 4 für Storage-I/O zugewiesen wurde. Sie implementierten auch NVIDIAs adaptive Routing-Technologie, um den Datenverkehr dynamisch über mehrere Pfade zu verteilen und Hotspots zu minimieren. Innerhalb von vier Wochen lief das gesamte Trainings-Fabric über RDMA, wobei alle 512 GPUs nahtlos über RoCE kommunizierten. DasMCX623106AN-CDAT-kompatibleÖkosystem erwies sich als robust – die Karten ließen sich problemlos in die H100-basierten Server und NVIDIAs NCCL (NVIDIA Collective Communications Library) integrieren, ohne dass Änderungen erforderlich waren.
Das Team bezog sich auf dasMCX623106AN-CDAT-Datenblattzur Feinabstimmung der Pufferzuweisung und der Congestion-Control-Parameter, um eine optimale Leistung für ihre gemischte Workload-Umgebung zu erzielen – die sowohl synchrones Training (All-Reduce-dominiert) als auch asynchrones Checkpointing umfasste.
Messbare Ergebnisse: Skalierungseffizienz, Durchsatz und GPU-Auslastung
Die Leistungssteigerung war transformativ. Mit RDMA über RoCE, das über denNVIDIA Mellanox MCX623106AN-CDATaktiviert wurde, sank die All-Reduce-Synchronisationslatenz von durchschnittlich 15,2 Sekunden auf nur 1,8 Sekunden pro Iteration – eine Verbesserung um das 8,4-fache. Dies führte direkt zu einer schnelleren Modellkonvergenz: Die gesamte Trainingszeit für ihr 70-Milliarden-Parameter-Modell sank von 42 Tagen auf 19 Tage, was ihren Forschungszyklus um über 50 % beschleunigte.
Die GPU-Auslastung, die aufgrund von Netzwerk-Stalls bei 62 % lag, sprang nach dem Upgrade auf 94 % – eine Verbesserung der effektiven Rechenkapazität um 52 %. Die fortschrittliche Out-of-Order-Datenplatzierung und das Packet-Pacing des Adapters eliminierten die Mikro-Bursts, die Tail-Latenzspitzen verursacht hatten, und sorgten für eine konsistente Leistung über alle Knoten hinweg.
Über die Trainingsleistung hinaus waren die Server-Durchsatzsteigerungen ebenso überzeugend. Die Hardware-Offload-Engine – einschließlich Checksum-Offload, LSO/LRO und RoCE-Beschleunigung – reduzierte die CPU-Auslastung für die Netzwerkverarbeitung von 38 % auf unter 4 % über alle Knoten hinweg. Dies gab erhebliche CPU-Kapazitäten für die Datenvorverarbeitung, Checkpoint-Kompression und andere Hilfsaufgaben frei, die zuvor eingeschränkt waren.
| Metrik | Vorher (Legacy 100GbE NIC) | Nachher (MCX623106AN-CDAT) | Verbesserung |
|---|---|---|---|
| All-Reduce-Latenz (pro Iteration) | 15,2 s | 1,8 s | 8,4x schneller |
| GPU-Auslastung | 62% | 94% | 52% höher |
| Modelltrainingszeit (70B Parameter) | 42 Tage | 19 Tage | 55% schneller |
| CPU-Netzwerk-Overhead | 38% | < 4% | 89% niedriger |
| NVMe-oF Lese-Latenz (Speicher) | 185 µs | 12 µs | 15x schneller |
Betriebliche Vorteile: TCO und Infrastruktureffizienz
Während die Leistungssteigerungen dramatisch waren, waren die betrieblichen und finanziellen Vorteile ebenso bemerkenswert. DieMCX623106AN-CDAT Ethernet-Adapterkartenlösungreduzierte die Gesamtbetriebskosten, indem sie die Notwendigkeit eines separaten InfiniBand-Fabrics eliminierte – und über 500.000 US-Dollar an Switch-Infrastrukturkosten einsparte. Das energieeffiziente Design des Adapters (unter 20 W pro Karte) trug zu messbaren Energieeinsparungen im 128-Knoten-Cluster bei und reduzierte die jährlichen Kühlungskosten um geschätzte 18 %.
Für IT-Manager, die denMCX623106AN-CDAT-Preisgegenüber alternativen Lösungen bewerten, stellte der Infrastruktur-Direktor von DeepCore fest, dass sich die Amortisationszeit unter sechs Monaten amortisierte – hauptsächlich durch die reduzierte Trainingszeit, die ihre Produktentwicklungs-Pipeline direkt beschleunigte. Das Team schätzte auch die Zukunftssicherheit des Adapters: DerselbeMCX623106AN-CDAT zum Verkaufunterstützt heute 200GbE, ist aber auch mit 100GbE- und 50GbE-Optiken kompatibel und bietet Flexibilität für Hybrid-Geschwindigkeitsumgebungen und schrittweise Upgrades.
Laut denMCX623106AN-CDAT-Spezifikationenenthält der Adapter umfassende Telemetriefunktionen, einschließlich In-Band Network Telemetry (INT) und Per-Flow-Latenzverfolgung. DeepCore integrierte diese Metriken in ihren Prometheus/Grafana-Stack, was eine proaktive Erkennung von Mikro-Congestion ermöglichte, bevor diese die Trainingsleistung beeinträchtigte. Das Team nutzte auch die Congestion-Control-Algorithmen des Adapters, um ECN-Schwellenwerte dynamisch anzupassen und verlustfreies Verhalten auch während Checkpointing-Operationen aufrechtzuerhalten, die zusätzliche Netzwerklast erzeugten.
Zusammenfassung & Ausblick: Ein Bauplan für KI-Skalierungs-Networking
Die Reise von DeepCore Labs mit demNVIDIA Mellanox MCX623106AN-CDATzeigt einen klaren Bauplan für Organisationen, die KI-Infrastrukturen aufbauen oder skalieren. Durch die Kombination von Dual-Port 200GbE-Durchsatz, PCIe 5.0-Host-Schnittstelle und GPUDirect-fähigem RDMA verwandelt dieMCX623106AN-CDAT Ethernet-Adapterkartedas Netzwerk von einem Skalierungsengpass in einen Leistungsverstärker. Die Ergebnisse – 8,4-mal schnelleres All-Reduce, 94 % GPU-Auslastung und 55 % schnellere Trainingszyklen – sprechen für die Fähigkeit des Adapters, greifbare Geschäftsergebnisse in den anspruchsvollsten Rechenumgebungen zu liefern.
Mit Blick auf die Zukunft, da die Modellgrößen weiterhin alle paar Monate verdoppelt werden und verteilte Trainingscluster auf Tausende von GPUs erweitert werden, bietet dieMCX623106AN-CDAT ConnectX Adapter PCIe-Netzwerkkarteeine solide Grundlage für verlustfreie Fabrics mit extrem niedriger Latenz. Für Architekten und IT-Leiter, die ihre nächste KI-Infrastruktur-Investition planen, stellt dieser Adapter nicht nur eine Komponente dar, sondern einen strategischen Wegbereiter für Wettbewerbsvorteile. Detaillierte Tuning-Parameter, Bereitstellungsskripte und Leistungs-Benchmark-Berichte sind im offiziellenMCX623106AN-CDAT-Datenblattverfügbar – eine wesentliche Referenz für jede groß angelegte KI-Bereitstellung.

