Илон Маск раскрыл технические детали масштабирования крупнейшего в мире суперкомпьютера Colossus 2, энергопотребление которого уже превысило отметку в 1 гигаватт. Одной из главных сенсаций стало объяснение жесткой математической логики, по которой вычислительные мощности кластера наращиваются партиями, кратными 110 тысячам графических ускорителей Nvidia. Как выяснилось, процесс модернизации упирается не в финансовые ограничения или дефицит площади ЦОД, а в сугубо физические параметры коммутационного оборудования.
Оптоволоконный предел и архитектура коммутаторов
Увеличение количества чипов Nvidia строго кратно 110 тысячам единиц из-за предельной пропускной способности и емкости оптоволоконной кабельной системы. Архитектура центрального коммутатора суперкомпьютера спроектирована таким образом, что максимальное количество физических оптоволоконных соединений, которые можно завести в узел без потери производительности и риска сбоев, строго регламентировано. Маск пояснил, что именно эта физическая граница кабельных портов определяет квант масштабирования всей инфраструктуры искусственного интеллекта.Эволюция кластеров и планы на будущее
Напомним, что предыдущая версия системы, известная как Colossus 1, объединяла 150 тысяч ускорителей Nvidia H100, 50 тысяч H200 и 30 тысяч чипов архитектуры GB200. Вторая генерация суперкомпьютера перешла на принципиально иной уровень масштабирования: базовый запуск Colossus 2 стартовал со 110 тысяч чипов Nvidia GB200, за которыми последовало запланированное внедрение чипов линейки GB300 крупными блоками по 440 тысяч единиц.
График ввода новых мощностей
Темпы развертывания нового оборудования поражают воображение участников рынка. Согласно актуальным планам инженерной команды Маска, еще 220 тысяч ускорителей GB300 должны быть полностью интегрированы и запущены в работу уже на следующей неделе. Следующая партия аналогичного объема в 220 тысяч чипов отправится в эксплуатацию в ноябре, а финальный этап текущей фазы расширения намечен на конец декабря, когда заработает еще один блок из 220 тысяч ускорителей GB300.Противоречивые данные
В экспертном сообществе и технологических СМИ возникают определенные дискуссии относительно точного распределения графических ускорителей между различными поколениями систем Илона Маска. В то время как официальные заявления подчеркивают плавный переход на архитектуры GB200 и GB300 с фиксированным шагом в 110 тысяч устройств, некоторые аналитические обзоры указывают на потенциальные логистические задержки при поставках передовой оптики. Тем не менее, инженерные отчеты подтверждают соблюдение заявленных сроков ввода энергоемких кластеров в промышленную эксплуатацию.