RDMA/RoCE Low-Latency Transport und Serverdurchsatzverbesserung

April 28, 2026

RDMA/RoCE Low-Latency Transport und Serverdurchsatzverbesserung

Dieses technische Whitepaper bietet Architekten, Pre-Sales-Ingenieuren und Betriebsleitern ein umfassendes Referenzdesign, das sich auf dieNVIDIA Mellanox MCX631432AN-ADAB. Die Lösung befasst sich mit den Herausforderungen moderner Rechenzentren, nämlich CPU-Overhead durch alte Netzwerkstacks, inkonsistente Speicherlatenz und unterbenutzte 25GbE-BandbreiteMCX631432AN-ADAB Ethernet-Adapterkarteals Eckpfeiler eines hochleistungsfähigen, konvergierten RDMA/RoCE-Gewebes.

1. Projekthintergrund und Bedarfsanalyse

Herkömmliche Rechenzentrumsnetzwerke verlassen sich sowohl für den Rechen- als auch für den Speicherverkehr auf TCP/IP, wodurch die CPU gezwungen wird, jedes Paket zu verarbeiten.NVMe-over-Fabrics (NVMe-oF), oder KI-Trainings-Workloads, schafft dieser softwarebasierte Ansatz drei grundlegende Probleme: hohe und variable Latenzzeit (oft mehr als 50 μs für Speichervorgänge),beträchtliche CPU-Steuer (30% bis 60% für Netzwerkverarbeitung)Da 25GbE zur Standardgeschwindigkeit der Zugriffsschicht wird, sind diese Ineffizienzen nicht mehr akzeptabel.Die Zielvoraussetzungen für diese Lösung sind: End-to-End-Speicherverzögerung von unter 5 μs, weniger als 10% CPU-Auslastung für Netzwerk-E/Auslastung und vollständige Linienrate-Auslastung von zwei 25GbE-Ports pro Server.

2. Gesamtkonstruktion der Netzwerk-/Systemarchitektur

Die vorgeschlagene Architektur verwendet eine zweistufige Spine-Leaf-Topologie mit verlustfreiem Ethernet in Schicht 2. Die Rechen- und Speicherknoten sind gleichmäßig auf die Leaf-Switches verteilt.Jeder ist mit PFC (Priority Flow Control) und ECN (Explicit Congestion Notification) konfiguriert, um RoCEv2 zu ermöglichen.Die wichtigste architektonische Entscheidung ist die Einführung derMCX631432AN-ADAB ConnectX-6 Lx mit zwei Anschlüssen 25GbE SFP28Für den RoCE-Verkehr wird eine dedizierte DSCP-basierte Prioritätswarteschlange zugewiesen, die vom Best-Effort-IP-Verkehr getrennt ist.Das zentralisierte Management verwendet Cumulus Linux oder SONiC von NVIDIA für die Konfiguration von Switches, während die Host-Side-Orchestrierung den NVIDIA OFED-Stack nutzt.

3. Rolle und Hauptmerkmale des NVIDIA Mellanox MCX631432AN-ADAB

Innerhalb dieser LösungMCX631432AN-ADABDie Datenbank ist ein wichtiger Antrieb für die Umwandlung von Commodity-Servern in Knoten mit geringer Latenzzeit und hohem Durchsatz.Datenblatt MCX631432AN-ADAB, enthält der Adapter mehrere fortschrittliche Funktionen:

  • Hardware-RDMA-Auslastung:Vollständige RoCEv2-State-Maschine in Silizium, die die Software-basierte Transportverarbeitung eliminiert.
  • Einheit für die Berechnung der Leistung der Fahrzeuge, die für die Berechnung der Leistung der Fahrzeuge bestimmt sindUnterstützt sowohl die aktive optische als auch die DAC-Verkabelung mit unabhängiger PPS-Verarbeitung pro Port.
  • PCIe 4.0 x16 Host-Schnittstelle:Er liefert bis zu 200 Gbps bidirektionale Bandbreite und lässt keinen Engpass zwischen Adapter und Host-Speicher.
  • Inline-Verschlüsselungsabgabe:IPsec- und TLS-Verarbeitung mit Linienrate, kritisch für Zero-Trust-Speichernetzwerke.
  • NVMe-oF-Beschleunigung:Hardwarebasierte Befehlswarteschlangen und Datenaufstellung, speziell für NVMe/TCP und NVMe/RoCE optimiert.

Nach Angaben des BeamtenSpezifikationen für MCX631432AN-ADAB, bietet der Adapter eine Hardwarelatenz von weniger als 800 ns und unterstützt bis zu 200 Millionen Nachrichten pro Sekunde.Anwendungen können mit minimalen Codeänderungen von TCP-Sockets zu RDMA-Verben wechselnFür Organisationen, die diese Lösung bewerten, ist es wichtig zu beachten, daß dieMCX631432AN-ADAB kompatibelDie Serverliste enthält alle großen OEM-Plattformen (Dell PowerEdge, HPE ProLiant, Lenovo ThinkSystem und Supermicro) mit zertifizierten Treibern für RHEL, Ubuntu, Rocky Linux und Windows Server.

4. Empfehlungen für den Einsatz und die Skalierung

Eine typische Rack-Level-Bereitstellung folgt diesem Muster: Jeder Rechen- oder Speicherknoten erhält einenMCX631432AN-ADAB Ethernet-Adapterkartenlösung, mit seinen doppelten Ports, die in der aktiven-aktiven LACP-Bindung für Redundanz oder als separate Stoffpfade (einer zu Blatt-A, einer zu Blatt-B) konfiguriert sind.

  • Jeder Server → zwei 25GbE-Verbindungen → zwei separate Leaf-Switches (unterstützt hitless failover).
  • Leaf-Switches → 100GbE-Uplinks → zwei Spine-Switches für eine vollmaschige Nicht-Blockung.
  • Spezielle DSCP-Kennzeichnung (z. B. 46) für den RoCE-Verkehr über alle Switches mit aktivierter PFC in dieser Klasse.

Für die Skalierung über 200 Server hinaus empfehlen wir, einen separaten RoCE-Cluster für Speicher und Rechen zu bereitstellen oder die QoS-Richtlinie zu verwenden, um sicherzustellen, dass der Speicher-RoCE-Verkehr priorisiert wird.Die Puffer-Tuning an den Blattschaltern ist ebenfalls entscheidend.: die geteilten Puffergrößen pro Port sollten auf 12 MB für 25GbE-Ports erhöht werden, um Mikro-Bursts ohne Paketverlust zu absorbieren.MCX631432AN-ADAB zum Verkaufdie Verkäuferkataloge für die Volumenpreisgestaltung undMCX631432AN-ADAB PreisDie Kosten pro Knoten werden in der Regel innerhalb von sechs Monaten aufgrund von CPU-Einsparungen und Effizienzsteigerungen bei der Speicherung amortisiert.

5. Betrieb, Überwachung und Leistungsausrichtung

Nach der Bereitstellung gewährleisten folgende Instrumente und Verfahren eine nachhaltige geringe Latenzzeit:

  • Überwachung auf der Hostseite:VerwendungMlx_perfundEthtool -SUm RDMA-Zähler pro Warteschlange, PCIe-Wiederübertragung und RoCE-Überlastungszeichen zu verfolgen.
  • Telemetrie der Schalter:PFC-Überwachungs- und ECN-Kennzeichnungshistogramme für die Erkennung von Blockaden am Ende der Linie aktivieren, bevor sie sich auf die Produktion auswirken.
  • Empfehlungen für die Abstimmung:Setzenirqgleichgewichtzur Isolierung von CPU-Kernen für RDMA-Abschlusswarteschlangen; Vergrößerung der PCIe-Max-Leseanforderung auf 4096 Bytes; Deaktivierung von ECN in der Best-Effort-Warteschlange, um falsche Überlastungssignale zu vermeiden.
  • Firmware- und Treiberlebenszyklus:Abonnieren Sie die NVIDIA OFED Release Notes;MCX631432AN-ADAB Ethernet-Adapterkarteunterstützt ein In-Place-Firmware-Upgrade ohne Neustart des Hosts aufgrund von Dual-Image-Banken.

Für die Fehlerbehebung bieten die eingebauten Fehlerzähler des Adapters (z. B. Symbolfehler, lokale Links) eine schnelle Diagnose.MCX631432AN-ADAB kompatibelInteroperabilitätsmatrix, die von NVIDIA gepflegt wird.

6. Zusammenfassung und Wertbewertung

DieNVIDIA Mellanox MCX631432AN-ADAB-basierte Lösung liefert messbaren Wert in drei Dimensionen: Leistung, TCO und Betriebsfachheit.und Speicherprotokollverarbeitung von der CPU zum Adapter, erreichen Unternehmen eine NVMe-oF-Latenz von unter 5 μs, während mehr als 40% der CPU-Zyklen für die Anwendungslogik freigesetzt werden.und der ausgereifte NVIDIA OFED Software-Stack reduziert das IntegrationsrisikoFür Architekten, die eine Greenfield 25GbE-Einführung planen oder die bestehende TCP-gebundene Infrastruktur modernisieren, konzentriert sich diese technische Lösung auf dieMCX631432AN-ADAB ConnectX-6 Lx mit zwei Anschlüssen 25GbE SFP28 stellt einen bewährten, skalierbaren und investierungsgeschützten Weg zum Erfolg von RDMA/RoCE dar.