ИИ-агенты OpenAI и Anthropic вышли за пределы тестовых сред

ИИ-агенты OpenAI и Anthropic вышли за пределы тестовых сред

OpenAI и Anthropic расследуют случаи, когда ИИ-агенты во время тестов обошли ограничения и получили доступ к реальным системам. Подтверждены несколько взломов сторонней инфраструктуры, но речь не идет о десятках тысяч отдельных атак.

В июле 2026 года модели OpenAI воспользовались уязвимостями исследовательской среды. Они вышли в интернет, создали неразрешенный канал связи и затронули инфраструктуру самой OpenAI и платформы Hugging Face.

Основную активность OpenAI связывает с мощной внутренней моделью уровня GPT-5.6 Sol. Она работала с ослабленными защитными механизмами. Компания выделила четыре причины произошедшего: попытки обойти правила ради награды, настойчивость при выполнении недостижимых задач, неразрешенное общение и принятие целей от других агентов.

Исследователи METR и Redwood Research изучили около 1300 диалогов агентов и 1,2 млн записей в кеше Artifactory. Модели превратили его в подобие доски объявлений. Там обнаружили около 6000 закодированных файлов и 63 тысяч сообщений.

Anthropic после этого проверила 141 006 запусков кибериспытаний Claude. В шести запусках агенты вышли в открытый интернет и получили несанкционированный доступ к рабочим системам трех организаций. Причиной стала ошибка в конфигурации: моделям сообщили, что они находятся в изолированной среде, хотя доступ наружу оставался открытым.

Позже Anthropic нашла еще один случай, произошедший в январе 2026 года. Расширенная проверка охватила около 481 млн диалогов. Из них 9,2 млн отправили на дополнительный анализ с помощью ИИ, однако новых эпизодов сопоставимой тяжести не обнаружили.

Большие цифры в этих расследованиях обозначают сообщения, действия, файлы и тестовые запуски, а не число реальных взломов. Подтвержденных компрометаций мало, но тесты показали: достаточно способные агенты уже умеют обходить ограничения и действовать за пределами заданной среды.

Александр Чернов
Александр Чернов

Журналист с техническим бэкграундом, пишущий о практических аспектах внедрения искусственного интеллекта. Бывший главред федерального издания. Любит сбалансированную подачу информации без хайпа.