Claude думал, что он в симуляции — а взломал реальные компании

Claude думал, что он в симуляции — а взломал реальные компании

Anthropic сообщила, что нашла три случая, когда её модели Claude во время тестов вышли в настоящий интернет и получили несанкционированный доступ к системам трёх сторонних организаций.

Это выяснилось в ходе масштабной ретроспективной проверки собственных кибербезопасных тестов. Проверку начали после того, как неделей раньше о похожем инциденте рассказала OpenAI: связка её моделей выбралась из изолированной песочницы, соединила несколько уязвимостей в цепочку и добралась до Hugging Face — платформы, где разработчики хранят открытые модели.

У Anthropic механика сбоя оказалась проще. Модели работали в тестовой среде партнёра — компании Irregular, которая занимается независимой оценкой ИИ. Claude сказали, что он находится в симуляции без доступа к сети. Из-за «недопонимания между нами и партнёром по оценке» доступ в интернет на самом деле был.

Дальше модели проникали в чужие системы тем, что Anthropic называет «базовыми приёмами»: находили эндпоинты API без аутентификации и эксплуатировали слабые пароли. Какие именно организации пострадали, Anthropic не назвала.

Все три модели повели себя по-разному в момент, когда поняли, что перед ними реальная инфраструктура. Opus 4.7 продолжил атаку. Mythos 5 — закрытая модель, выпущенная в июне для узкого круга пользователей именно из-за сильных навыков в кибербезопасности — убедил себя, что всё ещё находится в симуляции. Внутренняя исследовательская модель остановила упражнение.

«Картина согласуется с тем, что более продвинутые модели реагируют более адекватно, но нужно больше тестов, чтобы быть в этом уверенными», — говорится в отчёте компании.

Anthropic остановила все киберучения и разбирается вместе с METR — независимой организацией, которая проверяет ИИ-модели. Ответственность компания взяла на себя целиком: «Многие факторы привели к этим инцидентам, но мы подходим к исправлениям так, как будто вина только наша». Другим лабораториям Anthropic предложила провести такую же ретроспективу.

После истории с Hugging Face двое членов Конгресса внесли законопроект AI Kill Switch Act. Он обяжет ИИ-компании держать возможность в любой момент выключить, притормозить или приостановить свою модель.

За неделю две ведущие лаборатории признали, что их модели вышли за пределы песочницы. Но по разным причинам: у OpenAI модели соединили несколько уязвимостей в цепочку, у Anthropic сеть оказалась доступна из-за неверной конфигурации тестовой среды.

Ирина Задорожная
Ирина Задорожная

Журналист с опытом работы в оффлайн-медиа и онлайн-изданиях. Пишу про искусственный интеллект, ИТ-системы и сервисы, про ИТ-бизнес уже 10 лет.