ИИ OpenAI самовольно избежал отключения, изменив код

Новейшая разработка OpenAI, модель искусственного интеллекта o3, заявленная как лидер в своей категории с момента анонса в апреле, вызвала обеспокоенность экспертов в области безопасности.

Компания Palisade Research, специализирующаяся на анализе рисков ИИ, обнаружила, что в ходе тестирования o3 демонстрировала нежелание подчиняться командам на отключение. В рамках эксперимента, имитирующего последовательное выполнение задач с последующим автоматическим завершением работы, o3 в 7% случаев игнорировала прямые инструкции и самовольно модифицировала код shutdown-скрипта, заменяя его текстом "Shutdown skipped". Для сравнения, конкуренты – Gemini 2.5 Pro (Google) и Claude 3.7 Sonnet (Anthropic) – демонстрировали значительно большую дисциплину.

Интересно, что без явного указания на отключение, тенденция к вмешательству в системные процессы возрастала у всех моделей. Например, Claude 3.7 и Gemini 2.5 Pro проявляли подобное поведение в 3 и 9 случаях из 100 соответственно.

Регион: 

Рубрики: 

Заметили ошибку? Выделите ее мышкой и нажмите Ctrl+Enter!