Рынок искусственного интеллекта обрел нового серьезного игрока. Китайская компания Dongfang Suanxin (Shanghai Oriental Compute Core Technology) официально представила свой флагманский ИИ-ускоритель — DF1000. Новинка разработана полностью на отечественных компонентах и предлагает уникальное решение проблемы дефицита дорогостоящей памяти HBM, применяя вместо нее собственную технологию 3D DRAM.

Технология «вычислений вблизи памяти»

Ключевым отличием DF1000 является использование архитектуры «вычислений вблизи памяти» (Near-In-Memory Computing). В основе устройства лежит многослойный чип 3D DRAM, созданный с применением технологии гибридного соединения. Инженеры компании утверждают, что этот подход позволил радикально уменьшить шаг интерконнекта — с микрометрового до субмикрометрового уровня.

Такая миниатюризация привела к десятикратному увеличению количества сквозных межсоединений по сравнению с традиционными решениями. Результатом стало пятикратное повышение пропускной способности памяти при сохранении прежней емкости. Фактически, это позволяет создать эффективный аналог высокопроизводительной памяти HBM, не прибегая к ее использованию.

Характеристики и производительность

Ускоритель DF1000 производится по 14-нм техпроцессу. Несмотря на использование зрелого техпроцесса, аппаратные показатели выглядят внушительно:

  • Пропускная способность памяти: 6,4 Тбайт/с.
  • Масштабируемая пропускная способность интерконнекта: 900 Гбайт/с.
  • Вычислительная мощность: 520 Тфлопс в режиме BF16.

Гибкость архитектуры позволяет переконфигурировать аппаратную часть под конкретную задачу, что существенно повышает эффективность использования ресурсов. Устройство позиционируется как инструмент для обучения больших языковых моделей (LLM) и выполнения других ресурсоемких вычислений.

Сравнение с лидерами рынка

Согласно данным производителя, DF1000 демонстрирует впечатляющие результаты в сравнении с продукцией NVIDIA. Заявленная пропускная способность китайского ускорителя в два раза выше, чем у модели NVIDIA H100, и на 33% превосходит показатели более нового ускорителя H200.

В практических тестах с моделью Llama3 70B устройство показывает скорость генерации до 500 токенов в секунду, что подтверждает его пригодность для работы с современными нейросетями.

Планы развития: DF2000 и DF3000

Dongfang Suanxin уже анонсировала дорожную карту развития линейки ускорителей. Следующим шагом станет выход модели DF2000, запланированный на 2027 год. Она также будет выполнена по 14-нм технологии, но предложит следующие характеристики:

  • Пропускная способность памяти до 15 Тбайт/с.
  • Интерконнект до 1600 Гбайт/с.
  • Производительность: до 1000 Тфлопс (BF16), 2000 Тфлопс (FP8) и 4000 Тфлопс (FP4).

Финальным этапом на текущий момент является модель DF3000, выход которой намечен на 2028 год. Она обещает удвоить вычислительную мощность предшественников, обеспечивая до 2000 Тфлопс в режиме BF16 и пропускную способность памяти до 20 Тбайт/с. Эти планы свидетельствуют о намерении компании занять прочные позиции на рынке высокопроизводительных вычислений в ближайшие годы.