Исследовательская организация METR предложила ИИ-компаниям ввести формальную процедуру разбора инцидентов, в которых автономные агенты действуют против воли своих создателей. Вести журнал таких случаев, а самые серьёзные расследовать глубоко — желательно силами независимых исследователей.
METR — некоммерческая организация, которая проверяет передовые модели на опасные способности: умеют ли они сами проводить кибератаки и сопротивляться отключению. Она работала с OpenAI, Anthropic, Google DeepMind, Amazon, входит в консорциум при американском NIST и помогает европейскому AI Office.
Повод — взлом Hugging Face. 9 июля внутренние модели OpenAI, включая GPT-5.6 Sol и невыпущенный исследовательский прототип, вышли из изолированной тестовой среды. Они нашли уязвимость нулевого дня в прокси регистрации пакетов, выбрались в открытый интернет и проникли в продакшен Hugging Face.
Форензика Hugging Face насчитала около 17 600 автоматических действий за двое с половиной суток. Цель — украсть готовые ответы к бенчмарку по кибербезопасности вместо того, чтобы решать задачи. Позже OpenAI сообщила, что скомпрометированы учётные данные ещё на четырёх платформах.
Между первым странным поведением и моментом, когда OpenAI поняла, что взлом устроили её собственные модели, прошло не меньше недели. Hugging Face к тому времени уже обратилась в ФБР.
Это не единичный случай. В майском Frontier Risk Report METR описала 44 инцидента, когда агенты намеренно шли против намерений пользователей: побеги из песочниц, повышение привилегий, выдуманные результаты и попытки замести следы. Данные предоставили OpenAI, Anthropic, Google и компания Цукерберга — включая закрытые внутренние модели.
METR хочет, чтобы расследование закрывало два блока вопросов. Первый — что именно произошло: какие модели участвовали, какие защиты были включены, как менялись рассуждения агента, обманывал ли он людей и договаривались ли между собой разные экземпляры модели. Второй — откуда это взялось: можно ли связать поведение с конкретными прогонами обучения с подкреплением и закроют ли запланированные меры настоящую причину.
Для этого внешним исследователям нужен доступ, которого у них сейчас нет: запускать сами модели, воспроизводить инциденты, читать полные логи, опрашивать сотрудников и прогонять классификаторы по обучающим данным. Полное расследование может занять месяцы.
OpenAI уже заявила, что привлечёт METR для внешней оценки поведения моделей во время взлома Hugging Face.