У умовах глобальної гонки штучного інтелекту Україна робить стратегічний крок до цифрового суверенітету. Голова Міністерства цифрової трансформації України Оксана Ферчук підтвердила створення національної великої мовної моделі (LLM) під назвою «Сяйво». Проєкт, який стане ключовим елементом цифрової інфраструктури країни, базується на передовій архітектурі Google Gemma 3 та адаптується під унікальні мовні та культурні особливості української мови.

Технологічний фундамент та інфраструктура

Розробка «Сяйво» — це масштабний державно-приватний партнерський проєкт. Технічну інфраструктуру, фінансування та організаційне супроводження бере на себе телекомунікаційний гігант «Київстар». Вибір базової моделі Gemma 3 від Google зумовлений її високою ефективністю та відкритістю, що дозволяє інженерам зосередитися на донавчанні (fine-tuning) під специфічні задачі українського ринку. Ключовим завданням на поточному етапі є адаптація токенізатора — компонента, який розбиває текст на смислові одиниці, щоб забезпечити максимально швидку та точну обробку української лексики та граматики.

Створення національного корпусу даних

Головним викликом для розробників залишається формування якісного національного корпусу даних. Для навчання моделі команда збирає та верифікує інформацію з понад 90 державних установ, наукових закладів, університетів та медіа-ресурсів. Особлива увага приділяється історичній достовірності: Державний архів України (Укрдержархів) вже надав понад 10 терабайт матеріалів, включаючи історичні документи, державні акти та наукові праці. Значна частина цих даних потребує складної оцифрування з паперових носіїв, що є трудомістким, але необхідним процесом для збереження історичної пам'яті у цифровому форматі.

Експертний контроль та безпека

Щоб гарантувати якість та безпеку роботи ШІ, сформовано спеціальний експертний комітет із понад 70 фахівців. Вони оцінюють модель за чотирма критичними напрямами: точність мови та глибина розуміння контексту, безпека (стійкість до галюцинацій, дезінформації та упередженості), відсутність дискримінаційних відповідей, а також порівняльний аналіз зі світовими аналогами. У червні 2025 року малий прототип «Сяйва» успішно пройшов етапи попереднього навчання (pre-training) та контрольованого донавчання (supervised fine-tuning), що підтвердило життєздатність обраної архітектури.

Плани щодо відкритого коду та інтеграції

Після завершення тестування та передачі проєкту державі, базова версія «Сяйва» та створені під час розробки українські датасети будуть опубліковані у відкритому доступі (open source). Це дозволить розробникам, бізнесу та вченим отримати технічний пайплайн для навчання моделі під власні продукти. У державному секторі «Сяйво» стане основою для майбутніх сервісів, таких як «Дія AI», освітній асистент у застосунку «Мрія» та інструменти для аналізу законодавства. Тестову версію моделі планується завершити до кінця 2026 року, а вже у січні 2027 року відкрити її для широкого кола користувачів.