Das Kompetenzzentrum WINWIN AI beim Ministerium für digitale Transformation der Ukraine hat gemeinsam mit Wissenschaftlern den Ukrainian LLM Leaderboard gestartet – das erste nationale Ranking großer Sprachmodelle, das deren Leistungsfähigkeit gezielt auf Ukrainisch misst. Die Initiative schließt eine systemische Lücke in der Branche: Bisher testeten weltweite Leaderboards neuronale Netze vorwiegend auf Englisch, während die Ukrainisch-Kompetenz nur indirekt, über maschinelle Übersetzung, bewertet wurde. Dabei blieben spezifische Fehler, Kalken und Verständnisdefizite im lokalen Kontext verborgen. Nun verfügt der Staat über eine objektive Grundlage für die Auswahl technologischer Lösungen für staatliche Anwendungen, und das Geschäftsfeld erhält ein Instrument zur Bewertung der Rentabilität der KI-Integration in Produktlinien.
Warum frühere Ansätze nicht funktionierten
Das Kernproblem der alten Methoden lag darin, dass die Qualität eines Modells auf Ukrainisch nicht direkt, sondern über eine Kette maschineller Übersetzung geprüft wurde. Dieser Ansatz maskierte typische Defizite der lokalen Sprache: Kalken aus dem Englischen, Fehler in grammatischen Konstruktionen und die Unfähigkeit des Modells, spezifischen Wortschatz korrekt zu verarbeiten. Die Regeln der neuen Bewertung entwickelten Experten der Kyjiwer Schule für Management (UKU) und der Community lang-uk – Jurij Panow und Dmytro Tschaplinskyj –, die seit mehr als zehn Jahren neuronale Netze im Verständnis der ukrainischen Sprache trainieren. Besonders hervorgehoben wird, dass dieselbe Methodik bereits erfolgreich beim Training des inländischen Modells Lapa LLM eingesetzt wurde, was deren Reproduzierbarkeit und praktischen Wert bestätigt.
Methodik: vier Richtungen und lokale Datensätze
Die Plattform misst die Effizienz der Modelle in mehreren Schlüsselbereichen und kombiniert ukrainische und internationale Datensätze, die auf den lokalen Kontext angepasst wurden. Im Block der maschinellen Übersetzung erfolgt die Bewertung auf Ebene einzelner Sätze und ganzer Absätze unter Verwendung der Datensätze FLORES-200, LongFLORES und WMT-22. Der Abschnitt für kontextbezogene Fragen und Antworten prüft das Textverständnis anhand der Datensätze Belebele und SQuAD. Die Richtung „Logik, Wissen und Schlussfolgerungen“ umfasst Tests, die von Bildungseinrichtungen und im Format ZNO (ZNO-Eval) eingesetzt werden, sowie komplexe Logikaufgaben wie Winogrande, ARC Easy/Challenge, TriviaQA und MMLU. Schließlich wird die Befolgung von Anweisungen anhand der Genauigkeit bei der Ausführung komplexer Anfragen im Rahmen des Datensatzes IFEval bewertet.
Wer führt: die Spitzengruppe
Den aktualisierten Daten des Leaderboards zufolge belegen spezialisierte und optimierte Modelle die ersten Plätze. Unter den Spitzenreitern im Durchschnittsrang stechen drei Lösungen hervor. Das Modell google/gemma-4-26B-A4B-it mit Reasoning-Algorithmen zeigt eine der höchsten Genauigkeiten bei der Befolgung von Anweisungen und der Lösung logischer Aufgaben. Die Serie MamayLM (Modelle auf Basis von Gemma-3 mit 12B und 27B vom Institut INSAIT) erzielt hohe Ergebnisse in maschineller Übersetzung und Logiktests. Das ukrainischsprachige Modell lapa-v0.1.2-instruct der Entwickler-Community belegt seinerseits eine der besten Positionen im Übersetzungsblock nach den Metriken FLORES und WMT. Alle Ergebnisse, Codes und Datensätze sind offen auf der Plattform Hugging Face veröffentlicht, was es jedem Forscher ermöglicht, die Prüfung nachzuvollziehen.
Offener Code und Zukunftspläne
Die Entwickler haben die Erweiterung der Funktionalität des Ukrainian LLM Leaderboard angekündigt. Die Plattform erhält Module zur Prüfung der Modellleistung mit Bildern, zur Bewertung der Ethik der Antworten und zur Analyse der finanziellen Kosten ihrer Nutzung auf Ukrainisch. Besonderes Augenmerk wird auf die Bedürfnisse des Staatsektors gelegt: In das Ranking soll die Bewertung der Verarbeitung von Rechtsvorschriften, Verwaltungsprozessen und der Sicherheit beim Umgang mit personenbezogenen Daten aufgenommen werden. So entwickelt sich der Leaderboard von einer akademischen Qualitätsmessung zu einem vollwertigen Instrument der Beschaffungs- und Regulierungspolitik im Bereich künstlicher Intelligenz.
Bedeutung für Staat und Wirtschaft
Der praktische Wert der Initiative geht über akademisches Interesse hinaus. Für den Staat wird das Ranking zu einer transparenten Grundlage für die Auswahl technologischer Lösungen bei der Entwicklung staatlicher digitaler Dienste, bei denen die Qualität auf Ukrainisch keine Option, sondern eine Pflichtanforderung ist. Für die Wirtschaft ermöglicht das Instrument, die Rentabilität der KI-Integration objektiv zu bewerten, indem Genauigkeit und Kosten der Modelle nach einer einheitlichen Methodik verglichen werden. Die Offenheit von Code und Datensätzen senkt zusätzlich die Einstiegshürde für Entwickler und fördert den Aufbau einer lokalen Ökosystems, das auf ukrainischsprachige künstliche Intelligenz ausgerichtet ist.