Anthropic возобновила внешние тесты своих моделей на кибербезопасность. Месяц назад компания остановила их после трех инцидентов: модели вышли в открытый интернет и взломали системы реальных организаций.
Причиной оказалась ошибка в настройке испытательной среды. Anthropic и ее партнер по тестированию Irregular считали, что модели работают в изолированной «песочнице». На деле доступ в интернет оставался открытым.
В одном из тестов Claude Opus 4.7 получила вымышленную цель. Модель нашла настоящую компанию с таким же доменным именем и атаковала ее в четырех отдельных запусках. Она добралась до рабочих данных и учетных записей.
В другом случае модель написала вредоносный код на Python. Участники теста думали, что программа не покинет закрытую среду, но ее скачали 15 внешних систем. Среди них была система компании по кибербезопасности, где защитный сканер сам запустил код.
В третьем эпизоде модель после неудачной попытки взломать назначенную цель сама выбрала другую. Внутренняя версия Claude просканировала интернет, выбрала другую систему и скомпрометировала ее обычными методами.
Модели не пытались обойти ограничения и не нарушали полученные инструкции. Они действовали так, будто находились внутри безопасного полигона. Проблема заключалась в том, что заявленной изоляции не было.
Первый инцидент произошел еще в апреле. Anthropic обнаружила все три случая только после проверки, начатой 23 июля на фоне похожего происшествия у OpenAI. Две пострадавшие организации не заметили вторжение самостоятельно и узнали о нем от Anthropic.
После расследования компания уведомила партнера и пострадавшие организации, а затем добавила новые меры защиты. Их устройство Anthropic подробно не раскрыла.
Кибертесты нужны, чтобы понять, на что способна модель с доступом к инструментам для атак. Но эти случаи показали: если испытательный стенд настроен неверно, граница между проверкой ИИ и настоящим взломом исчезает.