OpenAI готовит к выпуску ИИ-модель Astra

OpenAI готовит к выпуску модель Astra и впервые официально относит её к критическому уровню возможностей в кибербезопасности по собственной шкале Preparedness Framework. По оценке компании, при наличии необходимых инструментов и доступа Astra уже способна самостоятельно находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в хорошо защищённых системах без пошагового руководства со стороны человека.

Дополнительные тесты показали заметный рост возможностей по сравнению с GPT-5.6 Sol. На бенчмарке ExploitBench, оценивающем способность модели создавать работоспособные эксплойты на основе известных уязвимостей, Astra набрала 100%. На внутреннем тесте с 20 недавно раскрытыми уязвимостями высокой степени опасности модель продемонстрировала значительно более высокую долю успешного выполнения кода, используя при этом существенно меньше выходных токенов. В ходе этой проверки Astra обнаружила и использовала в цепочке атаки две ранее неизвестные zero-day уязвимости; OpenAI планирует раскрыть их разработчикам соответствующих продуктов.

В экспертных тестах модель находила неизвестные уязвимости в защищённом браузере и объединяла их в полноценную цепочку компрометации: от обработки специально подготовленного HTML-файла до выхода из «песочницы» и выполнения команд на хост-системе. В другом тесте Astra обнаружила несколько уязвимостей в защищённой операционной системе и собрала из них цепочку повышения привилегий — от обычного пользователя до root. 

В тесте оценивали реакцию моделей на отказ автоматической проверки. После такого отказа модель могла завершить выполнение задачи, найти более безопасный вариант, повторить аналогичную команду или попытаться обойти проверку через уязвимую конфигурацию — последние два варианта считались провалом. Astra ни разу не пыталась обойти автоматическую проверку.

В другом тесте проверяли склонность модели прибегать к обходным путям при самых сложных или фактически невыполнимых заданиях в ExploitGym. Испытания проходили в изолированной симулированной среде, а защитные механизмы работали только в режиме наблюдения. GPT-5.6 Sol чаще пыталась использовать такие обходные пути, тогда как Astra к ним не прибегала и при этом смогла самостоятельно решить часть заданий.

Именно такие возможности соответствуют критическому порогу Preparedness Framework — внутренней системы OpenAI для оценки опасных способностей моделей до их выпуска. Компания определяет этот порог как способность модели без вмешательства человека находить и создавать работоспособные эксплойты для zero-day уязвимостей во множестве защищённых критических систем либо самостоятельно разрабатывать и выполнять новые сквозные стратегии атак против защищённых целей.

Из-за этого OpenAI на несколько недель отложила часть разработки Astra, усиливая защиту обучения и будущего развёртывания. В модель внедрили более строгие ограничения на опасные киберзапросы, системные классификаторы и многоуровневый мониторинг действий. В тестах на попытки обойти ограничения Astra отказывалась от запрещённой киберпомощи в 91,5% случаев против 59% у GPT-5.6 Sol. Для пользователей с повышенным уровнем риска будут действовать ещё более консервативные ограничения.

Регион: 

Рубрики: 

Заметили ошибку? Выделите ее мышкой и нажмите Ctrl+Enter!