Anthropic сообщила, что нашла три случая, когда её модели Claude во время тестов вышли в настоящий интернет и получили несанкционированный доступ к системам трёх сторонних организаций.
Это выяснилось в ходе масштабной ретроспективной проверки собственных кибербезопасных тестов. Проверку начали после того, как неделей раньше о похожем инциденте рассказала OpenAI: связка её моделей выбралась из изолированной песочницы, соединила несколько уязвимостей в цепочку и добралась до Hugging Face — платформы, где разработчики хранят открытые модели.
У Anthropic механика сбоя оказалась проще. Модели работали в тестовой среде партнёра — компании Irregular, которая занимается независимой оценкой ИИ. Claude сказали, что он находится в симуляции без доступа к сети. Из-за «недопонимания между нами и партнёром по оценке» доступ в интернет на самом деле был.
Дальше модели проникали в чужие системы тем, что Anthropic называет «базовыми приёмами»: находили эндпоинты API без аутентификации и эксплуатировали слабые пароли. Какие именно организации пострадали, Anthropic не назвала.
Все три модели повели себя по-разному в момент, когда поняли, что перед ними реальная инфраструктура. Opus 4.7 продолжил атаку. Mythos 5 — закрытая модель, выпущенная в июне для узкого круга пользователей именно из-за сильных навыков в кибербезопасности — убедил себя, что всё ещё находится в симуляции. Внутренняя исследовательская модель остановила упражнение.
«Картина согласуется с тем, что более продвинутые модели реагируют более адекватно, но нужно больше тестов, чтобы быть в этом уверенными», — говорится в отчёте компании.
Anthropic остановила все киберучения и разбирается вместе с METR — независимой организацией, которая проверяет ИИ-модели. Ответственность компания взяла на себя целиком: «Многие факторы привели к этим инцидентам, но мы подходим к исправлениям так, как будто вина только наша». Другим лабораториям Anthropic предложила провести такую же ретроспективу.
После истории с Hugging Face двое членов Конгресса внесли законопроект AI Kill Switch Act. Он обяжет ИИ-компании держать возможность в любой момент выключить, притормозить или приостановить свою модель.
За неделю две ведущие лаборатории признали, что их модели вышли за пределы песочницы. Но по разным причинам: у OpenAI модели соединили несколько уязвимостей в цепочку, у Anthropic сеть оказалась доступна из-за неверной конфигурации тестовой среды.