---
title: "Ukraine startet Ukrainian LLM Leaderboard: Nationaler Test für Neuronale Netze im Ukrainisch-Know-how"
description: "Das Ministerium für digitale Transformation und WINWIN AI haben den Ukrainian LLM Leaderboard gestartet – das erste nationale Ranking großer Sprachmodelle auf Ukrainisch. In der Spitzengruppe: gemma-4, MamayLM und lapa-v0.1.2-instruct."
date: 2026-08-24T14:22:02.000Z
lang: de
url: https://xab.info/de/posts/ukrainian-llm-leaderboard-nationaler-ki-ranking-test
tags: [ukrainian-llm-leaderboard, artificial-intelligence, large-language-models, ukrainian-language, winwin-ai, hugging-face]
publisher: "XAB.info"
---

# Ukraine startet Ukrainian LLM Leaderboard: Nationaler Test für Neuronale Netze im Ukrainisch-Know-how

![Abstrakte Visualisierung eines neuronalen Netzes aus leuchtenden Partikeln auf schwarzem Hintergrund — Symbol des Ukrainian LLM Leaderboard, der nationalen Prüfung für Sprachmodelle im Ukrainischen](https://xab.info/media/2026/08/24/ukrainian-llm-leaderboard-natsionalnyi-reiting-ii/ukrainian-llm-leaderboard-natsionalnyi-reiting-ii-1.webp)

## 🎯 Key Points

- WINWIN AI beim Ministerium für digitale Transformation hat den Ukrainian LLM Leaderboard gestartet – das erste nationale LLM-Ranking auf Ukrainisch
- Die Methodik wurde von Experten der UKU und lang-uk (Jurij Panow, Dmytro Tschaplinskyj) entwickelt und zuvor beim Training von Lapa LLM eingesetzt
- Die Bewertung erfolgt in vier Richtungen: maschinelle Übersetzung, kontextbezogene QA, Logik und Schlussfolgerungen, Befolgung von Anweisungen
- Spitzenreiter: google/gemma-4-26B-A4B-it, MamayLM (INSAIT) und lapa-v0.1.2-instruct
- Alle Ergebnisse und Datensätze sind auf Hugging Face offen; geplant sind Module für Bilder, Ethik und Kosten

Das Kompetenzzentrum WINWIN AI beim Ministerium für digitale Transformation der Ukraine hat gemeinsam mit Wissenschaftlern den Ukrainian LLM Leaderboard gestartet – das erste nationale Ranking großer Sprachmodelle, das deren Leistungsfähigkeit gezielt auf Ukrainisch misst. Die Initiative schließt eine systemische Lücke in der Branche: Bisher testeten weltweite Leaderboards neuronale Netze vorwiegend auf Englisch, während die Ukrainisch-Kompetenz nur indirekt, über maschinelle Übersetzung, bewertet wurde. Dabei blieben spezifische Fehler, Kalken und Verständnisdefizite im lokalen Kontext verborgen. Nun verfügt der Staat über eine objektive Grundlage für die Auswahl technologischer Lösungen für staatliche Anwendungen, und das Geschäftsfeld erhält ein Instrument zur Bewertung der Rentabilität der KI-Integration in Produktlinien.

### Warum frühere Ansätze nicht funktionierten

Das Kernproblem der alten Methoden lag darin, dass die Qualität eines Modells auf Ukrainisch nicht direkt, sondern über eine Kette maschineller Übersetzung geprüft wurde. Dieser Ansatz maskierte typische Defizite der lokalen Sprache: Kalken aus dem Englischen, Fehler in grammatischen Konstruktionen und die Unfähigkeit des Modells, spezifischen Wortschatz korrekt zu verarbeiten. Die Regeln der neuen Bewertung entwickelten Experten der Kyjiwer Schule für Management (UKU) und der Community lang-uk – Jurij Panow und Dmytro Tschaplinskyj –, die seit mehr als zehn Jahren neuronale Netze im Verständnis der ukrainischen Sprache trainieren. Besonders hervorgehoben wird, dass dieselbe Methodik bereits erfolgreich beim Training des inländischen Modells Lapa LLM eingesetzt wurde, was deren Reproduzierbarkeit und praktischen Wert bestätigt.

### Methodik: vier Richtungen und lokale Datensätze

Die Plattform misst die Effizienz der Modelle in mehreren Schlüsselbereichen und kombiniert ukrainische und internationale Datensätze, die auf den lokalen Kontext angepasst wurden. Im Block der maschinellen Übersetzung erfolgt die Bewertung auf Ebene einzelner Sätze und ganzer Absätze unter Verwendung der Datensätze FLORES-200, LongFLORES und WMT-22. Der Abschnitt für kontextbezogene Fragen und Antworten prüft das Textverständnis anhand der Datensätze Belebele und SQuAD. Die Richtung „Logik, Wissen und Schlussfolgerungen“ umfasst Tests, die von Bildungseinrichtungen und im Format ZNO (ZNO-Eval) eingesetzt werden, sowie komplexe Logikaufgaben wie Winogrande, ARC Easy/Challenge, TriviaQA und MMLU. Schließlich wird die Befolgung von Anweisungen anhand der Genauigkeit bei der Ausführung komplexer Anfragen im Rahmen des Datensatzes IFEval bewertet.

### Wer führt: die Spitzengruppe

Den aktualisierten Daten des Leaderboards zufolge belegen spezialisierte und optimierte Modelle die ersten Plätze. Unter den Spitzenreitern im Durchschnittsrang stechen drei Lösungen hervor. Das Modell google/gemma-4-26B-A4B-it mit Reasoning-Algorithmen zeigt eine der höchsten Genauigkeiten bei der Befolgung von Anweisungen und der Lösung logischer Aufgaben. Die Serie MamayLM (Modelle auf Basis von Gemma-3 mit 12B und 27B vom Institut INSAIT) erzielt hohe Ergebnisse in maschineller Übersetzung und Logiktests. Das ukrainischsprachige Modell lapa-v0.1.2-instruct der Entwickler-Community belegt seinerseits eine der besten Positionen im Übersetzungsblock nach den Metriken FLORES und WMT. Alle Ergebnisse, Codes und Datensätze sind offen auf der Plattform Hugging Face veröffentlicht, was es jedem Forscher ermöglicht, die Prüfung nachzuvollziehen.

### Offener Code und Zukunftspläne

Die Entwickler haben die Erweiterung der Funktionalität des Ukrainian LLM Leaderboard angekündigt. Die Plattform erhält Module zur Prüfung der Modellleistung mit Bildern, zur Bewertung der Ethik der Antworten und zur Analyse der finanziellen Kosten ihrer Nutzung auf Ukrainisch. Besonderes Augenmerk wird auf die Bedürfnisse des Staatsektors gelegt: In das Ranking soll die Bewertung der Verarbeitung von Rechtsvorschriften, Verwaltungsprozessen und der Sicherheit beim Umgang mit personenbezogenen Daten aufgenommen werden. So entwickelt sich der Leaderboard von einer akademischen Qualitätsmessung zu einem vollwertigen Instrument der Beschaffungs- und Regulierungspolitik im Bereich künstlicher Intelligenz.

### Bedeutung für Staat und Wirtschaft

Der praktische Wert der Initiative geht über akademisches Interesse hinaus. Für den Staat wird das Ranking zu einer transparenten Grundlage für die Auswahl technologischer Lösungen bei der Entwicklung staatlicher digitaler Dienste, bei denen die Qualität auf Ukrainisch keine Option, sondern eine Pflichtanforderung ist. Für die Wirtschaft ermöglicht das Instrument, die Rentabilität der KI-Integration objektiv zu bewerten, indem Genauigkeit und Kosten der Modelle nach einer einheitlichen Methodik verglichen werden. Die Offenheit von Code und Datensätzen senkt zusätzlich die Einstiegshürde für Entwickler und fördert den Aufbau einer lokalen Ökosystems, das auf ukrainischsprachige künstliche Intelligenz ausgerichtet ist.

## 🔍 Fact-Check Verification

- [Ministerium für digitale Transformation hat KI-Ranking nach Ukrainisch-Know-how erstellt: Wer führt](https://www.rbc.ua/ukr/news/mintsifri-sformuvalo-reyting-shi-znannyam-1787580856.html) - Подтверждает запуск рейтинга Минцифры по знанию украинского языка и наличие топа моделей.
- [Prüfung im Sprachwissen: In der Ukraine wurde das erste nationale Ranking von KI-Modellen gestartet](https://delo.ua/ru/news/ekzamen-na-znanie-yazyka-v-ukraine-zapustili-pervyi-nacionalnyi-reiting-ii-modelei-471265/) - Подтверждает статус инициативы как первого национального рейтинга ИИ-моделей в Украине.

## ❓ FAQ

### Q: Was ist der Ukrainian LLM Leaderboard?
**A:** Es ist das erste nationale Ranking großer Sprachmodelle, gestartet vom Zentrum WINWIN AI beim ukrainischen Ministerium für digitale Transformation. Es misst objektiv die Leistungsfähigkeit neuronaler Netze auf Ukrainisch, im Gegensatz zu weltweiten Rankings, die auf Englisch ausgerichtet sind.

### Q: Wer hat die Bewertungsmethodik entwickelt?
**A:** Die Bewertungsregeln entwickelten Experten der UKU und der Community lang-uk – Jurij Panow und Dmytro Tschaplinskyj –, die seit mehr als zehn Jahren neuronale Netze im Verständnis der ukrainischen Sprache trainieren. Dieselbe Methodik wurde beim Training des Modells Lapa LLM eingesetzt.

### Q: Welche Modelle belegen die ersten Plätze?
**A:** Unter den Spitzenreitern im Durchschnittsrang sind google/gemma-4-26B-A4B-it mit Reasoning-Algorithmen, die Serie MamayLM vom Institut INSAIT und das ukrainischsprachige lapa-v0.1.2-instruct. Alle Ergebnisse und Datensätze sind auf Hugging Face offen.

### Q: Was soll dem Ranking in Zukunft hinzugefügt werden?
**A:** Die Entwickler planen Module zur Prüfung der Bildverarbeitung, zur Bewertung der Ethik der Antworten, zur Analyse der finanziellen Kosten der Modelle sowie zur Bewertung der Verarbeitung von Rechtsvorschriften und der Sicherheit personenbezogener Daten für den Staatsektor.