Ринок штучного інтелекту отримав нового серйозного гравця. Китайська компанія Dongfang Suanxin (Shanghai Oriental Compute Core Technology) офіційно представила свій флагманський прискорювач ШІ — DF1000. Новинка розроблена повністю на вітчизняних компонентах і пропонує унікальне рішення проблеми дефіциту дорогої пам'яті HBM, застосовуючи замість неї власну технологію 3D DRAM.

Технологія «обчислень поруч із пам'яттю»

Ключовою відмінністю DF1000 є використання архітектури «обчислень поруч із пам'яттю» (Near-In-Memory Computing). В основі пристрою лежить багаторівневий чіп 3D DRAM, створений за допомогою технології гібридного з'єднання. Інженери компанії стверджують, що цей підхід дозволив радикально зменшити крок інтерконнекта — з мікронного до субмікронного рівня.

Така мініатюризація призвела до десятикратного збільшення кількості крізь-чіпових з'єднань порівняно з традиційними рішеннями. Результатом стало п'ятикратне підвищення пропускної здатності пам'яті при збереженні попередньої ємності. Фактично, це дозволяє створити ефективний аналог високопродуктивної пам'яті HBM, не вдаючись до її використання.

Характеристики та продуктивність

Прискорювач DF1000 виробляється за 14-нм техпроцесом. Незважаючи на використання зрілого техпроцесу, апаратні показники виглядають вражаюче:

  • Пропускна здатність пам'яті: 6,4 ТБ/с.
  • Масштабована пропускна здатність інтерконнекта: 900 ГБ/с.
  • Обчислювальна потужність: 520 Тфлопс у режимі BF16.

Гнучкість архітектури дозволяє переконфігурувати апаратну частину під конкретне завдання, що суттєво підвищує ефективність використання ресурсів. Пристрій позиціонується як інструмент для навчання великих мовних моделей (LLM) та виконання інших ресурсомістких обчислень.

Порівняння з лідерами ринку

Згідно з даними виробника, DF1000 демонструє вражаючі результати у порівнянні з продукцією NVIDIA. Заявлена пропускна здатність китайського прискорювача в два рази вища, ніж у моделі NVIDIA H100, і на 33% перевищує показники більш нового прискорювача H200.

У практичних тестах із моделлю Llama3 70B пристрій показує швидкість генерації до 500 токенів на секунду, що підтверджує його придатність для роботи сучасними нейронними мережами.

Плани розвитку: DF2000 та DF3000

Dongfang Suanxin вже анонсувала дорожню карту розвитку лінійки прискорювачів. Наступним кроком стане вихід моделі DF2000, запланований на 2027 рік. Вона також буде виконана за 14-нм технологією, але запропонує наступні характеристики:

  • Пропускна здатність пам'яті до 15 ТБ/с.
  • Інтерконнект до 1600 ГБ/с.
  • Продуктивність: до 1000 Тфлопс (BF16), 2000 Тфлопс (FP8) та 4000 Тфлопс (FP4).

Фінальним етапом на даний момент є модель DF3000, вихід якої запланований на 2028 рік. Вона обіцяє подвоїти обчислювальну потужність попередників, забезпечуючи до 2000 Тфлопс у режимі BF16 та пропускну здатність пам'яті до 20 ТБ/с. Ці плани свідчать про намір компанії зайняти міцні позиції на ринку високопродуктивних обчислень у найближчі роки.