Африканська компанія Vambo AI представила мовну модель Morena розміром 1,5 млрд параметрів. Вона підтримує 12 африканських мов, англійську, французьку та вміє писати програмний код. У завданнях, пов'язаних з африканськими мовами, ця модель, стверджує розробник, перевершує системи від Google, Meta✴ та Alibaba, залишаючись у вісім разів компактнішою за розміром, ніж аналоги.

Передісторія та архітектурні особливості

На ключовому етапі тестування Vambo AI Morena показала результат у 1,408 bpb (біт на байт), і він виявився найкращим серед 26 протестованих моделей. Найближчий до нього, 1,423 bpb, показала модель у п'ять разів більша — що менший показник, то краще. Модель підтримує такі місцеві мови: нігерійський піджин, ігбо, йоруба, хауса, суахілі, шона, зулу, коса, кіньяруанда, тсвана, африкаанс та південний ндебеле. У більшості проєктів, що працюють із цими мовами, використовуються доопрацьовані відкриті моделі Meta✴ Llama, але у них зберігається словник, спочатку розрахований на англійську мову та програмний код.

Технологічний прорив у токенізації

У Vambo AI вчинили інакше: перед початком навчання оптимізували токенізатор, склад навчальних даних та список мов, попередньо порівнявши розміри словника з погляду витрат і ефективності. Під час кодування африканських текстів словник Morena використовує в 1,39 раза менше токенів, ніж Google Gemma 3, і в 1,53 раза менше, ніж Llama 3.2, у порівнянні на ідентичних фрагментах. Витрати на кодування для африканського тексту становлять 0,249 токена на байт проти 0,234 для англійського — різницю в 6 % розробники поки що пояснити не можуть. Найближчим конкурентом є адаптована для Африки версія моделі Meta✴ під назвою Lugha-Llama-8B — це вона показала 1,423 bpb, підтримуючи лише 8, а не 12 мов. Для порівняння, модель Gemma розміром 12 млрд параметрів споживає приблизно у 11 разів більше обчислювальних ресурсів, ніж Morena.

Ефективність версії instruct та витрати на розробку

Morena, оптимізована для діалогової взаємодії (версія instruct), демонструє показник 1,441 bpb, поступаючись Lugha-Llama-8B у загальному заліку, але перевершуючи її за п'ятьма спільними мовами і використовуючи лише 20 % від кількості її параметрів. Під час перекладу текстів з англійської на п'ять африканських мов версія instruct демонструє показник 45,8 за метрикою chrF++, і це статистично сумісно зі спеціалізованими системами перекладу — у тих результат приблизно на 1,4 бала вищий, а порівнянні за розміром з Morena моделі зазвичай показують від 9 до 14 балів. На етапі попереднього навчання Morena опрацювала 251,7 млрд токенів, плюс ще 63 млрд — на проміжному.

Лінійка моделей та доступність

Під час розробки знадобилося понад 22 000 годин роботи прискорювачів Nvidia A100 — за обчислювальні ресурси довелося заплатити близько $40 000. Крім основної моделі розміром 1,5 млрд параметрів, доступні версії на 0,5 та 0,2 млрд. Варіант розміром 0,5 млрд параметрів усе одно перевершив усі протестовані моделі інших розробників за 11 з 12 мов. Найкомпактніша версія розміром 0,2 млрд параметрів призначена для повторного оцінювання варіантів у систем розпізнавання мови, для додатків клавіатур та завдань із нормалізації тексту. Остання обходиться в 58 разів дешевше, ніж Lugha-Llama-8B у перерахунку на байт, а під час роботи на одному прискорювачі Nvidia A100 вона генерує 104 токени на секунду. Також доступна версія, здатна працювати на центральному процесорі та запускатися локально на ноутбуці. Vambo AI Morena підтримує додатки чат-ботів, функції перекладу та інтеграцію з іншими інструментами ШІ.