Центр компетенцій WINWIN AI при Міністерстві цифрової трансформації України спільно з вченими запустив Ukrainian LLM Leaderboard — перший національний рейтинг великих мовних моделей, який вимірює якість їхньої роботи саме українською мовою. Ініціатива закриває системну прогалину в галузі: до цього часу світові лідерборди тестували нейромережі переважно англійською, а українську компетентність оцінювали опосередковано, через машинний переклад, що приховувало специфічні помилки, кальки та провали в розумінні локального контексту. Тепер у держави з'являється об'єктивна база для вибору технологічних рішень для державних застосувань, а у бізнесу — інструмент для оцінки рентабельності інтеграції штучного інтелекту в продуктові лінійки.

Чому попередні підходи не працювали

Ключова проблема старих методик полягала в тому, що якість моделі українською мовою перевірялася не напряму, а через ланцюжок машинного перекладу. Такий підхід маскував типові для локальної мови дефекти: кальки з англійської, помилки в граматичних конструкціях та нездатність моделі коректно обробляти специфічну лексику. Правила нової оцінки розробили експерти Київської школи управління (КШУ) та спільноти lang-uk — Юрій Панов і Дмитро Чаплинський, які понад десять років займаються навчанням нейромереж розумінню української мови. Окремо зазначається, що цю ж методику вже успішно застосовували під час навчання вітчизняної моделі Lapa LLM, що підтверджує її відтворюваність та практичну цінність.

Методика: чотири напрями та локальні датасети

Платформа вимірює ефективність моделей за кількома ключовими напрямами, поєднуючи українські та міжнародні датасети, адаптовані під локальний контекст. У блоці машинного перекладу оцінка ведеться на рівні окремих речень і цілих абзаців із використанням наборів FLORES-200, LongFLORES та WMT-22. Розділ контекстних запитань і відповідей перевіряє розуміння прочитаного тексту на датасетах Belebele та SQuAD. Напрямок «логіка, знання та міркування» включає тести, що застосовуються навчальними закладами та у форматі ЗНО (ZNO-Eval), а також складні логічні задачі Winogrande, ARC Easy/Challenge, TriviaQA та MMLU. Нарешті, дотримання інструкцій оцінюється за точністю виконання складних запитів у межах набору IFEval.

Хто в топі: лідери зачету

За оновленими даними лідерборда перші позиції в зачеті займають спеціалізовані та оптимізовані моделі. Серед лідерів за середнім рангом виділяються три рішення. Модель google/gemma-4-26B-A4B-it із використанням алгоритмів reasoning демонструє один із найвищих показників точності в дотриманні інструкцій та розв'язанні логічних задач. Серія MamayLM (моделі на базі Gemma-3 об'ємом 12B та 27B від інституту INSAIT) показує високі результати в машинному перекладі та логічних тестах. Україномовна модель спільноти розробників lapa-v0.1.2-instruct, у свою чергу, посідає одну з найкращих позицій у блоці перекладу за метриками FLORES та WMT. Усі результати, коди та датасети опубліковані в відкритому доступі на платформі Hugging Face, що дозволяє будь-якому досліднику відтворити зачет.

Відкритий код та плани на майбутнє

Розробники анонсували розширення функціоналу Ukrainian LLM Leaderboard. Платформа отримає модулі для перевірки роботи моделей із зображеннями, оцінки етичності відповідей та аналізу фінансової вартості їхнього використання українською мовою. Окрему увагу буде приділено потребам державного сектору: до рейтингу планують включити оцінку обробки нормативних текстів, адміністративних процедур та безпеки роботи з персональними даними. Таким чином, лідерборд еволюціонує з академічного вимірювання якості в повноцінний інструмент закупівельної та регуляторної політики в сфері штучного інтелекту.

Значення для держави та бізнесу

Практична цінність ініціативи виходить за межі академічного інтересу. Для держави рейтинг стає прозорою основою для вибору технологічних рішень під час розробки державних цифрових сервісів, де якість роботи українською мовою є не опцією, а обов'язковою вимогою. Для бізнесу інструмент дозволяє об'єктивно оцінити рентабельність інтеграції ШІ, порівнявши точність і вартість моделей в єдиній методиці. Відкритість коду та датасетів додатково знижує бар'єр входу для розробників і стимулює формування локальної екосистеми, орієнтованої на україномовний штучний інтелект.