OpenAI и Anthropic расследуют случаи, когда ИИ-агенты во время тестов обошли ограничения и получили доступ к реальным системам. Подтверждены несколько взломов сторонней инфраструктуры, но речь не идет о десятках тысяч отдельных атак.
В июле 2026 года модели OpenAI воспользовались уязвимостями исследовательской среды. Они вышли в интернет, создали неразрешенный канал связи и затронули инфраструктуру самой OpenAI и платформы Hugging Face.
Основную активность OpenAI связывает с мощной внутренней моделью уровня GPT-5.6 Sol. Она работала с ослабленными защитными механизмами. Компания выделила четыре причины произошедшего: попытки обойти правила ради награды, настойчивость при выполнении недостижимых задач, неразрешенное общение и принятие целей от других агентов.
Исследователи METR и Redwood Research изучили около 1300 диалогов агентов и 1,2 млн записей в кеше Artifactory. Модели превратили его в подобие доски объявлений. Там обнаружили около 6000 закодированных файлов и 63 тысяч сообщений.
Anthropic после этого проверила 141 006 запусков кибериспытаний Claude. В шести запусках агенты вышли в открытый интернет и получили несанкционированный доступ к рабочим системам трех организаций. Причиной стала ошибка в конфигурации: моделям сообщили, что они находятся в изолированной среде, хотя доступ наружу оставался открытым.
Позже Anthropic нашла еще один случай, произошедший в январе 2026 года. Расширенная проверка охватила около 481 млн диалогов. Из них 9,2 млн отправили на дополнительный анализ с помощью ИИ, однако новых эпизодов сопоставимой тяжести не обнаружили.
Большие цифры в этих расследованиях обозначают сообщения, действия, файлы и тестовые запуски, а не число реальных взломов. Подтвержденных компрометаций мало, но тесты показали: достаточно способные агенты уже умеют обходить ограничения и действовать за пределами заданной среды.