В условиях глобальной гонки искусственного интеллекта Украина делает стратегический шаг к цифровому суверенитету. Глава Министерства цифрового развития Украины Оксана Ферчук подтвердила создание национальной большой языковой модели (LLM) под названием «Сяйво». Проект, который станет ключевым элементом цифровой инфраструктуры страны, базируется на передовой архитектуре Google Gemma 3 и адаптируется под уникальные лингвистические и культурные особенности украинского языка.
Технологический фундамент и инфраструктура
Разработка «Сяйво» — это масштабный государственно-частный партнерский проект. Техническую инфраструктуру, финансирование и организационное сопровождение берет на себя телекоммуникационный гигант «Киевстар». Выбор базовой модели Gemma 3 от Google обусловлен ее высокой эффективностью и открытостью, что позволяет инженерам сосредоточиться на дообучении (fine-tuning) под специфические задачи украинского рынка. Ключевой задачей на текущем этапе является адаптация токенизатора — компонента, который разбивает текст на смысловые единицы, чтобы обеспечить максимально быструю и точную обработку украинской лексики и грамматики.
Создание национального корпуса данных
Главным вызовом для разработчиков остается формирование качественного национального корпуса данных. Для обучения модели команда собирает и верифицирует информацию из более чем 90 государственных учреждений, научных заведений, университетов и медиа-ресурсов. Особое внимание уделяется исторической достоверности: Государственный архив Украины (Укргосархив) уже предоставил более 10 терабайт материалов, включая исторические документы, государственные акты и научные труды. Значительная часть этих данных требует сложной оцифровки с бумажных носителей, что является трудоемким, но необходимым процессом для сохранения исторической памяти в цифровом формате.
Экспертный контроль и безопасность
Чтобы гарантировать качество и безопасность работы ИИ, сформирован специальный экспертный комитет из более чем 70 специалистов. Они оценивают модель по четырем критическим направлениям: точность языка и глубина понимания контекста, безопасность (устойчивость к галлюцинациям, дезинформации и предвзятости), отсутствие дискриминационных ответов, а также сравнительный анализ с мировыми аналогами. В июне 2025 года маломасштабный прототип «Сяйва» успешно прошел этапы предварительного обучения (pre-training) и контролируемой донастройки (supervised fine-tuning), что подтвердило жизнеспособность выбранной архитектуры.
Планы по открытому коду и интеграции
После завершения тестирования и передачи проекта государству, базовая версия «Сяйва» и созданные при разработке украинские датасеты будут опубликованы в открытом доступе (open source). Это позволит разработчикам, бизнесу и ученым получить технический пайплайн для обучения модели под собственные продукты. В государственном секторе «Сяйво» станет основой для будущих сервисов, таких как «Дія AI», образовательный ассистент в приложении «Мрія» и инструменты для анализа законодательства. Тестовую версию модели планируется завершить к концу 2026 года, а уже в январе 2027 года открыть ее для широкого круга пользователей.