Microsoft выпустила две новые ИИ-модели

Microsoft вывела в публичный предварительный просмотр две новые собственные модели искусственного интеллекта. MAI-Image-2.5-Pro стала флагманским генератором изображений компании, а MAI-Voice-2-Flash рассчитана на распознавание речи в условиях высокой нагрузки корпоративных приложений.

Софтверный гигант подчёркивает показатели производительности обеих моделей как ключевой аргумент в пользу самостоятельного развития ИИ‑решений без опоры на OpenAI. Сейчас модели Microsoft уже используются в ряде продуктов — Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot и Azure — и превратились не в исследовательские прототипы, а в рабочую инфраструктуру для миллионов клиентов. «Каждое из этих улучшений — шаг к одной и той же цели: продукты Microsoft, работающие на основе моделей Microsoft», — заявили в компании.

По сочетанию «качество–скорость–стоимость» новые модели заняли разные, специально выбранные позиции. MAI-Image-2.5-Pro позиционируется как премиальное решение: она создаёт изображения высокого качества, поддерживает тонкое редактирование и аккуратную прорисовку текста. При доступе через API стоимость составляет $5 за 1 млн текстовых токенов на вводе, $8 за 1 млн токенов изображений на вводе и $106 за 1 млн токенов изображений на выводе. Базовая версия MAI-Image-2.5 недавно заняла второе место в рейтинге моделей для редактирования изображений на платформе Arena.

MAI-Voice-2-Flash ориентирована на скорость и масштаб: по данным Microsoft, она работает в два раза быстрее базовой модели и на 32% дешевле — $15 за 1 млн знаков. Модель предназначена для высокопроизводительных голосовых сценариев: кол‑центров, голосовых агентов и приложений для обработки речи в реальном времени, где критична низкая задержка. Потребности творческой студии, стремящейся к максимальной точности, и службы поддержки, обрабатывающей миллионы вызовов в день, очевидно отличаются.

Microsoft также отчиталась о внедрениях новых моделей в своих сервисах. Bing Image Creator полностью перешёл на MAI-Image-2.5; в PowerPoint её использование позволило снизить затраты GPU на 84% по сравнению с OpenAI GPT‑Image‑2; модель также помогла оптимизировать обработку задач в OneDrive. MAI-Voice-2-Flash развернули в Dynamics 365 Contact Center, где это сокращение GPU‑затрат достигло до 89%; модель интегрировали и в Azure Voice Live для разработчиков. Кроме того, сервис Microsoft Dragon Copilot, применяемый в 170 000 медицинских учреждений и обработавший 28 млн обращений пациентов в первом квартале, переведён на MAI-Transcribe-1.5 с поддержкой 58 языков.

Облегчённая модель MAI-Code-1-Flash для автодополнения и генерации кода в июне начала работать в GitHub Copilot. По сравнению с OpenAI GPT‑5.4 Mini и Anthropic Claude Haiku 4.5 она демонстрирует на 10% более высокий уровень принятия предложенного кода при на 10% меньшем медианном потреблении токенов. Пользователи выбирают её повторно на 6% чаще, чем GPT‑5.4 Mini, и на 11% чаще, чем Claude Haiku 4.5. Microsoft дополнительно адаптировала модель для работы в Excel, где в большинстве типовых задач она достигает уровня GPT‑5.6, оставаясь при этом достаточно компактной, чтобы запускаться на устаревших ускорителях Nvidia H100 и даже A100.

Регион: 

Рубрики: 

Заметили ошибку? Выделите ее мышкой и нажмите Ctrl+Enter!