Elon Musk hat technische Details zur Skalierung des weltgrößten Supercomputers Colossus 2 bekannt gegeben, dessen Stromverbrauch bereits die Marke von 1 Gigawatt überschritten hat. Eine der wichtigsten Enthüllungen war die Erklärung der strengen mathematischen Logik, nach der die Rechenleistung des Clusters in Chargen von jeweils 110.000 Nvidia-Grafikbeschleunigern erweitert wird. Wie sich herausstellte, stößt der Modernisierungsprozess nicht an finanzielle Grenzen oder Platzmangel im Rechenzentrum, sondern an rein physikalische Parameter der Vermittlungsausrüstung.

Glasfaser-Limit und Switch-Architektur

Die Erhöhung der Anzahl von Nvidia-Chips erfolgt streng als Vielfaches von 110.000 Einheiten aufgrund der maximalen Bandbreite und Kapazität des Glasfaserkabelsystems. Die zentrale Switch-Architektur des Supercomputers ist so konzipiert, dass die maximale Anzahl physischer Glasfaserverbindungen, die ohne Leistungsverlust oder Ausfallrisiko in einen Knoten geführt werden können, streng reguliert ist. Musk erklärte, dass genau diese physische Grenze der Kabelports das Skalierungsquantum für die gesamte KI-Infrastruktur bestimmt.

Cluster-Evolution und Zukunftspläne

Zur Erinnerung: Die vorherige Version des Systems, bekannt als Colossus 1, vereinte 150.000 Nvidia H100-Beschleuniger, 50.000 H200 und 30.000 Chips der GB200-Architektur. Die zweite Generation des Supercomputers wechselte auf ein grundlegend anderes Skalierungsniveau: Der Basisstart von Colossus 2 begann mit 110.000 Nvidia GB200-Chips, gefolgt von der geplannten Einführung von GB300-Chips in massiven Blöcken zu je 440.000 Einheiten.

Zeitplan für die Bereitstellung neuer Kapazitäten

Das Tempo der Bereitstellung neuer Hardware versetzt die Marktteilnehmer in Staunen. Den aktuellen Plänen von Musks Ingenieursteam zufolge sollen weitere 220.000 GB300-Beschleuniger in der kommenden Woche vollständig integriert und in Betrieb genommen werden. Eine weitere Charge von 220.000 Chips geht im November live, und die Endphase der aktuellen Erweiterung ist für Ende Dezember geplant, wenn ein weiterer Block mit 220.000 GB300-Beschleunigern online geht.

Widersprüchliche Daten

In der Expertencommunity und den Technologie-Medien gibt es gewisse Diskussionen über die genaue Verteilung der Grafikbeschleuniger auf die verschiedenen Generationen von Elon Musks Systemen. Während offizielle Erklärungen einen reibungslosen Übergang zu den Architekturen GB200 und GB300 mit einem festen Schritt von 110.000 Geräten betonen, verweisen einige analytische Berichte auf mögliche logistische Verzögerungen bei der Lieferung fortschrittlicher Optiken. Dennoch bestätigen technische Berichte die Einhaltung der angegebenen Fristen für die Inbetriebnahme der energieintensiven Cluster im kommerziellen Betrieb.