Африканская компания Vambo AI представила ИИ-модель Morena

Добавить KV.by в основные
источники Google

Африканская компания Vambo AI представила компактную языковую модель Morena (1,5 млрд параметров), которая поддерживает 12 африканских языков, английский и французский, а также умеет генерировать код. По заявлению разработчиков, в задачах на африканских языках Morena превосходит решения Google, Meta и Alibaba, оставаясь при этом в восемь раз компактнее аналогов.

Ключевые результаты тестирования

На основном этапе оценки Morena показала результат 1,408 bpb (бит на байт) — лучший среди 26 протестированных моделей. Ближайший конкурент, Lugha-Llama-8B (адаптированная для Африки версия Meta Llama), набрал 1,423 bpb, хотя эта модель в пять раз больше. Чем ниже показатель bpb, тем эффективнее модель.

Morena поддерживает следующие языки: нигерийский пиджин, игбо, йоруба, хауса, суахили, шона, зулу, коса, киньяруанда, тсвана, африкаанс и южный ндебеле.

Оптимизация токенизатора и словаря

В отличие от большинства проектов, использующих дообученные открытые модели Meta Llama (у которых словарь изначально ориентирован на английский и код), в Vambo AI перед обучением оптимизировали токенизатор, состав данных и список языков. В результате при кодировании африканских текстов словарь Morena использует в 1,39 раза меньше токенов, чем Google Gemma 3, и в 1,53 раза меньше, чем Llama 3.2 (на идентичных фрагментах).

Издержки кодирования для африканского текста составляют 0,249 токена на байт против 0,234 для английского — разницу в 6% разработчики пока не объяснили. Для сравнения: 12-миллиардная Gemma потребляет примерно в 11 раз больше вычислительных ресурсов, чем Morena.

Версия instruct и перевод

Диалоговая версия Morena (instruct) демонстрирует 1,441 bpb — формально уступая Lugha-Llama-8B в общем зачёте, но превосходя её по пяти общим языкам при использовании лишь 20% параметров. При переводе с английского на пять африканских языков instruct-версия набирает 45,8 по метрике chrF++, что статистически сопоставимо со специализированными системами перевода (у них результат примерно на 1,4 балла выше). Модели сопоставимого с Morena размера обычно показывают от 9 до 14 баллов.

На этапе предобучения Morena обработала 251,7 млрд токенов, ещё 63 млрд — на промежуточном этапе.

Стоимость разработки и варианты модели

На создание модели потребовалось более 22 000 часов работы ускорителей Nvidia A100; вычислительные ресурсы обошлись примерно в $40 000. Помимо основной версии на 1,5 млрд параметров, доступны модели на 0,5 и 0,2 млрд параметров. Вариант на 0,5 млрд превзошёл все протестированные сторонние модели по 11 из 12 языков.

Самая компактная версия (0,2 млрд) предназначена для повторной оценки в системах распознавания речи, клавиатурных приложениях и задачах нормализации текста. Она обходится в 58 раз дешевле Lugha-Llama-8B в пересчёте на байт и на одном A100 генерирует 104 токена в секунду. Есть также вариант для запуска на CPU локально на ноутбуке. Morena поддерживает чат-боты, перевод и интеграцию с другими ИИ-инструментами.

Регион: 

Рубрики: 

Заметили ошибку? Выделите ее мышкой и нажмите Ctrl+Enter!