
Компания Meituan представила LongCat‑Flash‑Omni — открытую мультимодальную модель ИИ, способную вести диалог в реальном времени с полным восприятием видео и аудио. Система нового поколения не просто распознаёт команды, но поддерживает естественное общение, учитывая изменения интонации и мимику собеседника.
Архитектура модели насчитывает 560 млрд параметров, однако в оперативной работе используется лишь около 27 млрд. Такой подход на базе технологии Mixture‑of‑Experts обеспечивает высокое качество взаимодействия при оптимальных вычислительных затратах.
Одно из главных достоинств LongCat‑Flash‑Omni — контекстное окно до 128 тыс. токенов. Это даёт возможность вести длительные диалоги, обрабатывать большие массивы информации и сохранять связность ответов на всём протяжении беседы. На популярных бенчмарках модель показала впечатляющие результаты: она возглавила рейтинги OmniBench и DailyOmni и продемонстрировала высокий уровень в задачах автоматического распознавания речи (ASR), ответов на вопросы по документам (DocVQA) и в задачах ссылочного понимания изображений (RefCOCO).
В сумме показателей LongCat‑Flash‑Omni превосходит Qwen3‑Omni Instruct и приближается по производительности к Google Gemini 2.5 Flash, что делает её одной из ведущих мультимодальных систем на данный момент. Ещё одна важная особенность проекта — его открытость: модель можно запускать локально, что даёт исследователям и разработчикам свободу изучать, модифицировать и адаптировать её под собственные задачи в отличие от большинства закрытых коммерческих решений.





