Центр компетенций WINWIN AI при Министерстве цифровой трансформации Украины совместно с учеными запустил Ukrainian LLM Leaderboard — первый национальный рейтинг больших языковых моделей, который измеряет качество их работы именно на украинском языке. Инициатива закрывает системный пробел в отрасли: до сих пор мировые лидерборды тестировали нейросети преимущественно на английском, а украинскую компетенцию оценивали опосредованно, через машинный перевод, что скрывало специфические ошибки, кальки и провалы в понимании локального контекста. Теперь у государства появляется объективная база для выбора технологических решений под государственные приложения, а у бизнеса — инструмент для оценки рентабельности интеграции искусственного интеллекта в продуктовые линейки.

Почему прежние подходы не работали

Ключевая проблема старых методик заключалась в том, что качество модели на украинском языке проверялось не напрямую, а через цепочку машинного перевода. Такой подход маскировал типовые для локального языка дефекты: кальки из английского, ошибки в грамматических конструкциях и неспособность модели корректно обрабатывать специфическую лексику. Правила новой оценки разработали эксперты Университета Киевской школы управления (УКУ) и сообщества lang-uk — Юрий Панов и Дмитрий Чаплинский, которые более десяти лет занимаются обучением нейросетей пониманию украинского языка. Отдельно отмечается, что эту же методику уже успешно применяли при обучении отечественной модели Lapa LLM, что подтверждает её воспроизводимость и практическую ценность.

Методика: четыре направления и локальные датасеты

Платформа измеряет эффективность моделей по нескольким ключевым направлениям, объединяя украинские и международные датасеты, адаптированные под локальный контекст. В блоке машинного перевода оценка ведётся на уровне отдельных предложений и целых абзацев с использованием наборов FLORES-200, LongFLORES и WMT-22. Раздел контекстных вопросов и ответов проверяет понимание прочитанного текста на датасетах Belebele и SQuAD. Направление «логика, знания и рассуждения» включает тесты, применяемые учебными заведениями и в формате ВНО (ZNO-Eval), а также сложные логические задачи Winogrande, ARC Easy/Challenge, TriviaQA и MMLU. Наконец, соблюдение инструкций оценивается по точности выполнения сложных запросов в рамках набора IFEval.

Кто в топе: лидеры зачета

По обновленным данным лидерборда первые позиции в зачете занимают специализированные и оптимизированные модели. Среди лидеров по среднему рангу выделяются три решения. Модель google/gemma-4-26B-A4B-it с использованием алгоритмов reasoning демонстрирует один из самых высоких показателей точности в соблюдении инструкций и решении логических задач. Серия MamayLM (модели на базе Gemma-3 объёмом 12B и 27B от института INSAIT) показывает высокие результаты в машинном переводе и логических тестах. Украиноязычная модель сообщества разработчиков lapa-v0.1.2-instruct, в свою очередь, занимает одну из лучших позиций в блоке перевода по метрикам FLORES и WMT. Все результаты, коды и датасеты опубликованы в открытом доступе на платформе Hugging Face, что позволяет любому исследователю воспроизвести зачёт.

Открытый код и планы на будущее

Разработчики анонсировали расширение функционала Ukrainian LLM Leaderboard. Платформа получит модули для проверки работы моделей с изображениями, оценки этичности ответов и анализа финансовой стоимости их использования на украинском языке. Отдельное внимание будет уделено потребностям государственного сектора: в рейтинг планируют включить оценку обработки нормативных текстов, административных процедур и безопасности работы с персональными данными. Таким образом, лидерборд эволюционирует из академического замера качества в полноценный инструмент закупочной и регуляторной политики в сфере искусственного интеллекта.

Значение для государства и бизнеса

Практическая ценность инициативы выходит за рамки академического интереса. Для государства рейтинг становится прозрачной основой для выбора технологических решений при разработке государственных цифровых сервисов, где качество работы на украинском языке является не опцией, а обязательным требованием. Для бизнеса инструмент позволяет объективно оценить рентабельность интеграции ИИ, сравнив точность и стоимость моделей в единой методике. Открытость кода и датасетов дополнительно снижает барьер входа для разработчиков и стимулирует формирование локальной экосистемы, ориентированной на украиноязычный искусственный интеллект.