GX10 Cluster - Grundlagen
Mehrere AI-Systeme verbinden, richtig verkabeln und gemeinsam nutzen
Mehrere NVIDIA DGX Spark, ASUS Ascent GX10, Lenovo ThinkStation PGX oder GIGABYTE GB10-Systeme lassen sich zu einem leistungsfähigen AI-Cluster verbinden.
Doch wie funktioniert das eigentlich? Wann reicht eine direkte Verbindung zwischen zwei Systemen und ab wann benötigst du einen High-Speed-Switch?
In diesem Guide zeigen wir dir, wie du verschiedene GB10-Systeme miteinander verbindest, welche Netzwerkhardware du benötigst und welche Rolle 200-Gbit/s-Netzwerke, RDMA, RoCE, NVIDIA NCCL und Software wie vLLM spielen.
Was ist ein AI-Cluster?
Ein AI-Cluster besteht aus mehreren Rechnern, die gemeinsam Rechenaufgaben bearbeiten.
Bei modernen NVIDIA-Systemen können mehrere Nodes beispielsweise gemeinsam große KI-Modelle ausführen oder Trainings- und Inference-Workloads verteilen.
Wichtig ist dabei:
Mehrere Systeme werden nicht automatisch zu einem einzigen Computer.
Die verwendete Software muss ausdrücklich für Distributed Computing beziehungsweise Multi-Node-AI ausgelegt sein.
Genau hier kommen Technologien wie NVIDIA NCCL, CUDA, PyTorch und vLLM ins Spiel.
Welche Systeme kann ich miteinander verbinden?
Besonders interessant sind kompakte Systeme auf Basis der NVIDIA GB10 Plattform.
Dazu gehören beispielsweise:
- NVIDIA DGX Spark
- ASUS Ascent GX10
- Lenovo ThinkStation PGX
- GIGABYTE AI TOP ATOM
- weitere kompatible GB10-Systeme
Bei einem Cluster ist daher nicht entscheidend, ob auf dem Gehäuse NVIDIA, ASUS, Lenovo oder GIGABYTE steht.
Entscheidend sind vielmehr eine kompatible Hardwareplattform sowie ein kompatibler NVIDIA-Software- und Netzwerkstack.
Brauche ich einen Switch?
Das ist eine der wichtigsten Fragen beim Aufbau eines AI-Clusters.
Die Antwort hängt hauptsächlich davon ab, wie viele Nodes du miteinander verbinden möchtest.
2 Systeme – kein Switch erforderlich
Wenn du nur zwei Systeme miteinander verbinden möchtest, können diese direkt miteinander verbunden werden.
NVIDIA DGX Spark → High-Speed-Verbindung → ASUS Ascent GX10
Für einen einfachen Zwei-Node-Cluster ist das die günstigste und unkomplizierteste Variante.
Ein zusätzlicher Switch ist bei einer direkten Verbindung nicht erforderlich.
3 oder mehr Systeme – Switch verwenden
Sobald drei oder mehr Systeme miteinander kommunizieren sollen, wird ein High-Speed-Switch zur typischen Lösung.
Node 1 → Switch ← Node 2
↕
Node 3
↕
Node 4
Jeder Node wird mit einem Port des Switches verbunden.
Dadurch musst du nicht für jeden Node mehrere direkte Punkt-zu-Punkt-Verbindungen aufbauen.
Die einfache Faustregel
1 Node: Kein Cluster-Netzwerk erforderlich
2 Nodes: Direkte High-Speed-Verbindung möglich
3–4 Nodes: High-Speed-Switch empfohlen
5–8 Nodes: High-Speed-Switch erforderlich
8+ Nodes: Professionelles AI-/HPC-Netzwerk sinnvoll
Kurz gesagt: Bei zwei Nodes kannst du direkt verbinden. Ab drei Nodes solltest du einen passenden High-Speed-Switch einplanen.
Welche Netzwerkgeschwindigkeit benötige ich?
Für Multi-Node-AI ist die Netzwerkgeschwindigkeit besonders wichtig.
Während der Berechnung werden zwischen den Nodes große Datenmengen übertragen. Je nach verwendeter AI-Anwendung kann die Netzwerkkommunikation einen erheblichen Teil der Gesamtleistung bestimmen.
Systeme auf Basis der NVIDIA GB10 Plattform verfügen über schnelle ConnectX-7-Netzwerkfunktionen, die für High-Speed-Kommunikation und RDMA/RoCE ausgelegt sind.
Für leistungsorientierte AI-Cluster sollte deshalb nicht einfach ein gewöhnlicher 1-Gbit/s-, 2,5-Gbit/s- oder 10-Gbit/s-Switch verwendet werden.
Wichtig: Bei AI-Clustern zählt nicht nur die maximale Bandbreite. Auch Latenz, RDMA/RoCE, MTU und die Konfiguration von NCCL haben einen erheblichen Einfluss auf die tatsächliche Clusterleistung.
Zwei NVIDIA Spark oder GX10 direkt verbinden
Bei zwei Nodes ist eine direkte Verbindung besonders interessant.
Die beiden Systeme werden dabei über ihre schnellen Netzwerkports miteinander verbunden.
NVIDIA DGX Spark ←→ 200G High-Speed-Link ←→ ASUS Ascent GX10
Dadurch entsteht ein dedizierter High-Speed-Link zwischen den beiden AI-Systemen.
Für zwei Nodes ist diese Lösung besonders interessant, weil kein zusätzlicher Switch angeschafft werden muss.
Mehrere Nodes über einen Switch verbinden
Bei vier Systemen sieht eine typische Topologie beispielsweise so aus:
NVIDIA DGX Spark
↓
200G High-Speed-Switch
↙ ↓ ↘
ASUS GX10 · Lenovo PGX · GIGABYTE GB10
Jeder Node besitzt dabei eine eigene Verbindung zum Switch.
Der Switch stellt die Kommunikation zwischen den einzelnen Nodes her und ermöglicht damit eine wesentlich flexiblere Cluster-Topologie.
200G oder 400G – welchen Switch brauche ich?
Ein 400-Gbit/s-Switch kann für größere Cluster interessant sein.
Allerdings bedeutet ein 400G-Port nicht automatisch, dass jedes angeschlossene System mit 400 Gbit/s betrieben werden kann.
Je nach Switch und verwendeter Hardware können Ports beispielsweise über Breakout-Kabel in mehrere niedrigere Geschwindigkeiten aufgeteilt werden.
Deshalb müssen Switch, Netzwerkadapter, Kabel, Transceiver und Breakout-Konfiguration immer zusammenpassen.
Darauf solltest du beim Switch achten
- Unterstützte Portgeschwindigkeiten
- QSFP-/QSFP-DD-Kompatibilität
- RDMA-/RoCE-Unterstützung
- Unterstützte Breakout-Modi
- Kompatibilität mit DACs und Transceivern
- MTU-Unterstützung
- Latenz
- NCCL-Performance
- Unterstützte Netzwerkfunktionen
Ein günstiger 400G-Switch ist deshalb nicht automatisch besser geeignet als ein passender 200G-Switch.
Welches Kabel brauche ich?
Bei High-Speed-Netzwerken sollte nicht einfach irgendein QSFP-Kabel verwendet werden.
Kabel und Ports müssen hinsichtlich Geschwindigkeit, Bauform und Protokoll kompatibel sein.
Besonders wichtig ist die Unterscheidung zwischen verschiedenen QSFP-Varianten und Geschwindigkeiten.
Ein Kabel mit der Aufschrift 400G ist nicht automatisch für jede 200G- oder 400G-Konfiguration geeignet.
Vor dem Kauf sollten deshalb immer die Kompatibilitätsangaben des jeweiligen Herstellers geprüft werden.
Für einen direkten 2-Node-Cluster empfehlen wir das 200G QSFP56 DAC Kabel – passend für NVIDIA DGX Spark, ASUS Ascent GX10 und andere GB10-Systeme.
Management-Netzwerk und AI-Netzwerk
Bei einem professionellen Aufbau kann es sinnvoll sein, zwei unterschiedliche Netzwerke zu verwenden.
Management-Netzwerk
Das Management-Netzwerk wird beispielsweise für folgende Aufgaben verwendet:
- Internet
- Updates
- SSH
- Administration
- Monitoring
- Weboberflächen
- Remote-Zugriff
Hier kann je nach Umgebung ein gewöhnlicher Ethernet-Switch eingesetzt werden.
AI-Netzwerk
Das High-Speed-Netzwerk wird dagegen für die Kommunikation zwischen den AI-Nodes verwendet:
- NCCL
- RDMA/RoCE
- Distributed Inference
- Tensor Parallelism
- Pipeline Parallelism
- Distributed Training
Die Trennung ist insbesondere bei größeren Installationen sinnvoll, da Management-Traffic und AI-Kommunikation nicht um dieselbe Bandbreite konkurrieren.
Wie kommunizieren die Nodes miteinander?
Nachdem die Netzwerkverbindung eingerichtet wurde, müssen die einzelnen Systeme miteinander kommunizieren können.
Typischerweise werden dafür unter anderem feste IP-Adressen, Hostnamen und SSH-Keys eingerichtet.
Beispielsweise:
node01
node02
node03
node04
Von einem Node sollte anschließend beispielsweise eine Verbindung zu den anderen Nodes möglich sein.
Für größere Cluster sollte die komplette Konfiguration möglichst automatisiert und reproduzierbar erfolgen.
Welche Rolle spielt NVIDIA NCCL?
Die Netzwerkverbindung alleine macht noch keinen AI-Cluster.
Für die Kommunikation zwischen NVIDIA-GPUs spielt die NVIDIA Collective Communications Library – NCCL eine zentrale Rolle.
NCCL stellt unter anderem Kommunikationsoperationen wie AllReduce, Broadcast und AllGather bereit und wird von vielen Distributed-AI-Frameworks verwendet.
Vor dem produktiven Einsatz sollte deshalb getestet werden, ob die Nodes tatsächlich mit der erwarteten Bandbreite und Latenz miteinander kommunizieren.
Eine schnelle Netzwerkverbindung bringt schließlich wenig, wenn die Software die vorhandene Bandbreite nicht effizient nutzen kann.
Kann ich NVIDIA Spark, ASUS GX10 und Lenovo PGX mischen?
Ja, unterschiedliche GB10-Systeme können grundsätzlich in einem gemeinsamen Cluster eingesetzt werden.
Ein möglicher Aufbau könnte beispielsweise so aussehen:
NVIDIA DGX Spark
↓
ASUS Ascent GX10
↓
Lenovo ThinkStation PGX
↓
GIGABYTE GB10
Entscheidend sind dabei nicht die Herstellerlogos, sondern die verwendete Plattform, Firmware, Treiber, CUDA-, NCCL- und Netzwerkumgebung.
Ein gemischter Cluster kann deshalb interessant sein, wenn bereits verschiedene GB10-Systeme vorhanden sind.
Wie wird aus mehreren Nodes ein AI-Cluster?
Nachdem Hardware und Netzwerk eingerichtet wurden, kommt die Softwareebene hinzu.
Anwendungen wie PyTorch oder vLLM können Distributed Computing nutzen und Aufgaben auf mehrere Nodes verteilen.
Damit können beispielsweise Modelle auf mehrere Systeme aufgeteilt werden, wenn ein einzelner Node nicht genügend Speicher oder Rechenleistung zur Verfügung stellt.
Tensor Parallelism
Beim Tensor Parallelism wird ein Modell auf mehrere GPUs beziehungsweise Nodes verteilt.
Vereinfacht bedeutet das:
AI-Modell
↓
Node 1 · Node 2 · Node 3 · Node 4
↓
Gemeinsame Berechnung
Die Nodes arbeiten dabei gemeinsam an der Berechnung.
Eine schnelle Verbindung zwischen den Nodes ist hierbei besonders wichtig, da während der Berechnung regelmäßig Daten zwischen den Systemen ausgetauscht werden.
Pipeline Parallelism
Eine weitere Möglichkeit ist Pipeline Parallelism.
Hier werden verschiedene Teile eines Modells auf unterschiedliche Nodes verteilt.
Input
↓
Node 1 – Layer 1–20
↓
Node 2 – Layer 21–40
↓
Node 3 – Layer 41–60
↓
Node 4 – Layer 61–80
↓
Output
Welche Parallelisierungsstrategie sinnvoll ist, hängt vom jeweiligen Modell, der verwendeten Software und dem gewünschten Workload ab.
Wie viel Speicher habe ich mit mehreren GB10-Systemen?
Ein einzelnes GB10-System verfügt über einen großen Unified-Memory-Bereich.
Werden mehrere Nodes für eine verteilte AI-Anwendung eingesetzt, kann die insgesamt nutzbare Speicherkapazität entsprechend erweitert werden.
Als vereinfachtes Beispiel:
- 1 × GB10: 128 GB
- 2 × GB10: 256 GB
- 4 × GB10: 512 GB
- 8 × GB10: 1 TB
Wichtig: Diese Werte bedeuten nicht, dass das Betriebssystem plötzlich einen einzigen gemeinsamen RAM-Pool sieht. Die verwendete Anwendung muss das Modell beziehungsweise die Berechnung ausdrücklich über mehrere Nodes verteilen.
Was brauche ich für einen 2-Node-Cluster?
Für einen einfachen Zwei-Node-Cluster benötigst du:
- 2 kompatible GB10-Systeme
- 1 × 200G QSFP56 DAC Kabel
- ein Management-Netzwerk beziehungsweise Internetzugang
- kompatible NVIDIA-Treiber und Software
- NCCL beziehungsweise eine Multi-Node-fähige Anwendung
Ein zusätzlicher AI-Switch ist bei zwei direkt verbundenen Nodes nicht erforderlich.
Das macht einen Zwei-Node-Cluster besonders attraktiv für erste Tests oder kleinere lokale AI-Projekte.
Was brauche ich für einen 4-Node-Cluster?
Für einen Cluster mit vier Systemen benötigst du:
- 4 kompatible GB10-Systeme
- einen passenden High-Speed-Switch
- passende High-Speed-Verbindungen
- ein Management-Netzwerk
- eine möglichst einheitliche Softwareumgebung
- NCCL
- eine Multi-Node-fähige AI-Anwendung
Für vier Nodes ist ein Switch die deutlich sauberere Lösung als mehrere direkte Punkt-zu-Punkt-Verbindungen.
Was brauche ich für einen größeren AI-Cluster?
Ab einer größeren Anzahl von Nodes sollte nicht mehr nur die Verkabelung betrachtet werden.
Auch folgende Themen werden zunehmend wichtig:
- Cluster-Management
- Monitoring
- automatische Bereitstellung
- Jobverwaltung
- Benutzerverwaltung
- Container
- Logging
- Fehlerüberwachung
- Software- und Firmware-Updates
Für größere Installationen kommen beispielsweise Slurm oder Kubernetes infrage.
Damit lassen sich viele Nodes zentral verwalten und AI-Workloads gezielt auf den verfügbaren Systemen ausführen.
Was bringt ein GB10-Cluster überhaupt?
Der größte Vorteil eines Multi-Node-Clusters liegt darin, dass AI-Modelle und Workloads auf mehrere Systeme verteilt werden können.
Das kann beispielsweise interessant sein für:
- große Large Language Models
- lokale AI-Assistenten
- RAG-Systeme
- Multi-Agent-Systeme
- AI-Inference
- Fine-Tuning
- Forschung und Entwicklung
- große Embedding-Modelle
- lokale AI-Server
- Entwicklungsumgebungen
Dabei geht es nicht ausschließlich um mehr Rechenleistung.
Besonders interessant ist die Möglichkeit, Modelle und Workloads zu betreiben, die auf einem einzelnen System nicht oder nur schwer ausgeführt werden können.
Produkte für deinen AI-Cluster
Alle kompatiblen GB10-Systeme und das passende Verbindungskabel findest du direkt in unserem Shop:
- ASUS Ascent GX10
- Lenovo ThinkStation PGX
- GIGABYTE AI TOP ATOM
- 200G QSFP56 DAC Kabel – für direkte 2-Node-Verbindungen
Fazit: So verbindest du deine GB10-Systeme
Mehrere NVIDIA DGX Spark, ASUS Ascent GX10, Lenovo ThinkStation PGX und andere kompatible GB10-Systeme können zu einem leistungsfähigen Multi-Node-AI-Cluster verbunden werden.
Die wichtigste Entscheidung ist zunächst die Anzahl der Nodes:
2 Nodes
Direkte High-Speed-Verbindung möglich.
3–4 Nodes
High-Speed-Switch empfohlen.
5–8 Nodes
High-Speed-Switch und sauber geplante AI-Fabric.
8+ Nodes
Professionelles AI-/HPC-Netzwerk und Cluster-Management sinnvoll.
Entscheidend ist dabei nicht nur die Anzahl der Systeme. Für eine hohe Performance müssen Netzwerk, Kabel, RDMA/RoCE, NCCL, Treiber und die eigentliche AI-Anwendung optimal zusammenspielen.
So lässt sich aus mehreren kompakten GB10-Systemen eine flexible lokale AI-Infrastruktur aufbauen – unabhängig davon, ob die einzelnen Nodes von NVIDIA, ASUS, Lenovo oder GIGABYTE stammen.






Share: