источники Google

Anthropic представила языковую модель Claude Opus 5.5 — первую в новом семействе Claude 5.5. Компания называет её своим новым флагманом: модель получила улучшения в агентном программировании, работе с компьютером и офисными задачами. По данным разработчика, средняя стоимость её использования снизилась на 40%.
Главное направление развития Claude Opus 5.5 — выполнение сложных и продолжительных задач. Модель умеет самостоятельно планировать работу, пользоваться инструментами, проверять промежуточные результаты и вносить изменения в крупные проекты.
По данным Anthropic, один из ранних пользователей с её помощью перенёс кодовую базу объёмом 680 тыс. строк менее чем за сутки. Вручную такая работа, по его оценке, заняла бы у команды инженеров несколько недель. В другом тесте модель проверила и исправила кодовую базу на 200 тыс. строк менее чем за три часа. Предыдущей версии Claude Opus 5 потребовалось более 20 часов и в 2,5 раза больше токенов.
В тесте по переносу HAProxy с C на Rust Claude Opus 5.5 справилась за 9,5 часа — на 2,5 часа быстрее Fable 5.1. При этом её использование обошлось на 51% дешевле. В испытаниях по оптимизации программного обеспечения модель сократила время загрузки веб-приложения в 39 из 40 случаев. Предыдущая версия чаще вносила менее значительные изменения и могла менять поведение приложения.
В бенчмарке Terminal-Bench 4.0, который оценивает способность ИИ-агентов выполнять многошаговые задачи в командной строке, Claude Opus 5.5 набрала 66,4%. Во FrontierCode v1.1 её результат составил 54,4%, а в CursorBench 4.0 — 57,8%. Anthropic уточняет, что показатели тестов не всегда полностью отражают разницу между флагманскими моделями, а практический разрыв между Opus 5.5 и Claude Fable 5.1 может быть меньше.
Разработчик также сообщает об улучшениях в работе с текстами, исследованиями, финансовыми моделями и деловыми документами. В тесте GDPval-AA v2.1, имитирующем профессиональные задачи по 44 специальностям, Claude Opus 5.5 получила 1846 баллов. У Fable 5.1 результат составил 1735 баллов, у Opus 5 — 1708.
В одном из внутренних испытаний модель готовила отчёт о финансовых результатах компании, находя данные в специально созданной копии интернета. Opus 5.5 успешно прошла тест в 16 из 18 попыток. Claude Fable 5.1 и Opus 5 не справились ни разу.
Anthropic также переработала стиль общения модели. По утверждению компании, Opus 5.5 лучше структурирует ответы, сразу выделяет ключевую информацию и реже использует жаргон и необычные формулировки. Это должно сделать её удобнее для длительной работы с пользователями.
Стоимость миллиона входных токенов снизилась с $5 до $4, выходных — с $25 до $20. Чтение из кэша подешевело с $0,50 до $0,20 за 1 млн токенов, а запись теперь стоит $5 вместо $6,25. С учётом меньшего количества токенов, необходимого для выполнения задач, средняя стоимость использования модели, по данным Anthropic, снизилась на 40%. Скорость генерации выросла более чем на 30%.
Для Claude Opus 5.5 предусмотрен ускоренный режим Fast Mode. В Claude Code и Claude Platform он обеспечивает скорость до 2,5 раза выше стандартной, но стоит $8 за 1 млн входных и $40 за 1 млн выходных токенов.
Перед выпуском модель прошла внешнее тестирование, в том числе с участием Frontier Design и METR. Anthropic утверждает, что Opus 5.5 лучше соблюдает заданные ограничения и примерно на 85% реже пытается выйти за пределы изолированной среды, чем Claude Opus 5 и Mythos 5.1. При этом компания признаёт, что полностью выявить риски поведения ИИ до его развёртывания невозможно.
Для чувствительных запросов в области кибербезопасности, биологии и дистилляции моделей предусмотрены дополнительные меры контроля. Большинство задач по кибербезопасности будут перенаправляться на Claude Opus 4.8, а расширенный доступ к Opus 5.5 получат только проверенные специалисты.
По данным Anthropic, новая модель лучше противостоит атакам с внедрением инструкций и реже совершает необратимые действия. Кроме того, компания внедрила механизм preserved thinking, который должен затруднить массовое извлечение внутренних рассуждений модели через сеть поддельных API-аккаунтов.
Claude Opus 5.5 уже доступна в чат-боте Claude, через API и другие сервисы Anthropic. В ближайшие недели компания планирует представить модели Claude Sonnet 5.5 и Claude Haiku 5.5 с аналогичными улучшениями производительности, эффективности и безопасности.






Горячие темы