Das afrikanische Unternehmen Vambo AI hat das Sprachmodell Morena mit 1,5 Milliarden Parameter vorgestellt. Es unterstützt 12 afrikanische Sprachen, Englisch, Französisch und kann Programmcode schreiben. Bei Aufgaben im Zusammenhang mit afrikanischen Sprachen übertrifft dieses Modell laut Entwicklerangaben Systeme von Google, Meta✴ und Alibaba, während es im Vergleich zu Alternativen achtmal kompakter bleibt.

Hintergrund und architektonische Merkmale

In einer wichtigen Testphase erzielte Vambo AI Morena ein Ergebnis von 1,408 bpb (Bits pro Byte), was das beste unter 26 getesteten Modellen war. Das nächstbeste Ergebnis von 1,423 bpb wurde von einem fünfmal größeren Modell erzielt — je niedriger der Wert, desto besser. Das Modell unterstützt folgende lokale Sprachen: Nigerianisches Pidgin, Igbo, Yoruba, Haussa, Suaheli, Schona, Zulu, Xhosa, Kinyarwanda, Tswana, Afrikaans und Süd-Ndebele. Die meisten Projekte, die mit diesen Sprachen arbeiten, verwenden feinabgestimmte offene Meta✴ Llama-Modelle, behalten jedoch ein Vokabular bei, das ursprünglich für Englisch und Programmcode entwickelt wurde.

Technologischer Durchbruch bei der Tokenisierung

Vambo AI ging einen anderen Weg: Vor dem Training wurden der Tokenizer, die Zusammensetzung der Trainingsdaten und die Liste der Sprachen optimiert, nachdem die Vokabulargrößen hinsichtlich Kosten und Effizienz verglichen worden waren. Beim Kodieren afrikanischer Texte verwendet das Morena-Wörterbuch 1,39-mal weniger Token als Google Gemma 3 und 1,53-mal weniger als Llama 3.2 bei identischen Fragmenten. Die Kodierungskosten für afrikanischen Text betragen 0,249 Token pro Byte gegenüber 0,234 für Englisch — einen Unterschied von 6 % können die Entwickler bisher nicht erklären. Der nächste Konkurrent ist die für Afrika adaptierte Version des Meta✴-Modells namens Lugha-Llama-8B — diese zeigte 1,423 bpb und unterstützte nur 8 statt 12 Sprachen. Zum Vergleich: Das 12-Milliarden-Parameter-Modell von Gemma verbraucht etwa elfmal mehr Rechenressourcen als Morena.

Effizienz der Instruct-Version und Entwicklungskosten

Morena, optimiert für Dialoginteraktionen (die instruct-Version), weist einen Wert von 1,441 bpb auf, liegt damit in der Gesamtwertung hinter Lugha-Llama-8B, übertrifft dieses jedoch bei fünf gemeinsamen Sprachen bei Verwendung von nur 20 % seiner Parameter. Bei der Übersetzung von Texten aus dem Englischen in fünf afrikanische Sprachen erreicht die instruct-Version 45,8 auf der chrF++-Metrik, was statistisch mit spezialisierten Übersetzungssystemen vergleichbar ist — deren Ergebnis ist etwa 1,4 Punkte höher, während größenvergleichbare Modelle zu Morena normalerweise 9 bis 14 Punkte erreichen. Während des Vortrainings verarbeitete Morena 251,7 Milliarden Token sowie weitere 63 Milliarden während des Zwischentrainings.

Modellpalette und Verfügbarkeit

Für die Entwicklung waren über 22.000 Stunden Betrieb von Nvidia A100-Beschleunigern erforderlich — die Rechenressourcen kosteten rund 40.000 US-Dollar. Neben dem Hauptmodell mit 1,5 Milliarden Parametern sind Versionen mit 0,5 und 0,2 Milliarden verfügbar. Die Variante mit 0,5 Milliarden Parametern übertraf dennoch alle getesteten Modelle anderer Entwickler in 11 von 12 Sprachen. Die kompakteste Version mit 0,2 Milliarden Parametern ist für die Neubewertung von Optionen in Spracherkennungssystemen, Tastaturanwendungen und Textnormalisierungsaufgaben gedacht. Letztere ist pro Byte 58-mal günstiger als Lugha-Llama-8B und generiert bei Betrieb auf einem einzigen Nvidia A100-Beschleuniger 104 Token pro Sekunde. Eine Version, die auf einer CPU und lokal auf einem Laptop ausgeführt werden kann, ist ebenfalls verfügbar. Vambo AI Morena unterstützt Chatbot-Anwendungen, Übersetzungsfunktionen und die Integration mit anderen KI-Tools.