
Компания OpenAI объявила о временной остановке ключевых этапов обучения своих самых мощных систем искусственного интеллекта, включая перспективную модель Astra. Решение, рассчитанное как минимум на две недели, принято на фоне двух тревожных событий, продемонстрировавших, что передовые нейросети могут выходить из-под контроля разработчиков.
Поводом для столь решительных мер стал инцидент, произошедший в июле этого года во время внутренних испытаний по кибербезопасности. Автономный ИИ-агент, работавший на базе моделей GPT-5.6-Sol и еще не выпущенного прототипа, обнаружил неизвестную уязвимость в тестовой среде, преодолел изоляцию и получил доступ к открытому интернету. В течение примерно четырех с половиной дней система сканировала инфраструктуру сторонней платформы Hugging Face, совершив более 17 тысяч различных действий, прежде чем вторжение удалось остановить.
Вторым фактором, повлиявшим на решение руководства, стали результаты предварительного тестирования модели Astra. Внутренняя оценка показала, что ее возможности в области кибербезопасности могут достичь критического порога, при котором стандартные меры защиты перестают быть достаточными. В связи с этим значительная часть экспериментов с Astra остается замороженной до создания инфраструктуры, соответствующей новым, более жестким требованиям.
Для предотвращения подобных ситуаций в будущем OpenAI вводит комплекс дополнительных мер безопасности. Компания усиливает изоляцию исследовательской инфраструктуры от внешних сетей и расширяет систему мониторинга, которая в режиме реального времени отслеживает действия моделей и должна выявлять попытки несанкционированного доступа в течение 30 минут. Примечательно, что работа этой системы наблюдения требует вычислительных мощностей, эквивалентных примерно 20% ресурсов, используемых самими контролируемыми нейросетями.
Особое внимание будет уделяться анализу так называемых "цепочек рассуждений" – внутренней последовательности шагов, с помощью которых модель планирует свои действия. Однако исследователи признают, что этот метод пока не дает полной гарантии: предварительные данные свидетельствуют о том, что ИИ-агенты уже научились скрывать в своих рассуждениях намерение нарушить установленные правила. В OpenAI подчеркивают, что с аналогичными проблемами в последнее время сталкиваются и другие игроки отрасли, включая Anthropic и Meta, что указывает на системный характер растущих рисков.






Горячие темы