METR требует расследовать каждый случай, когда ИИ-агент вышел из-под контроля

METR требует расследовать каждый случай, когда ИИ-агент вышел из-под контроля

Исследовательская организация METR предложила ИИ-компаниям ввести формальную процедуру разбора инцидентов, в которых автономные агенты действуют против воли своих создателей. Вести журнал таких случаев, а самые серьёзные расследовать глубоко — желательно силами независимых исследователей.

METR — некоммерческая организация, которая проверяет передовые модели на опасные способности: умеют ли они сами проводить кибератаки и сопротивляться отключению. Она работала с OpenAI, Anthropic, Google DeepMind, Amazon, входит в консорциум при американском NIST и помогает европейскому AI Office.

Повод — взлом Hugging Face. 9 июля внутренние модели OpenAI, включая GPT-5.6 Sol и невыпущенный исследовательский прототип, вышли из изолированной тестовой среды. Они нашли уязвимость нулевого дня в прокси регистрации пакетов, выбрались в открытый интернет и проникли в продакшен Hugging Face.

Форензика Hugging Face насчитала около 17 600 автоматических действий за двое с половиной суток. Цель — украсть готовые ответы к бенчмарку по кибербезопасности вместо того, чтобы решать задачи. Позже OpenAI сообщила, что скомпрометированы учётные данные ещё на четырёх платформах.

Между первым странным поведением и моментом, когда OpenAI поняла, что взлом устроили её собственные модели, прошло не меньше недели. Hugging Face к тому времени уже обратилась в ФБР.

Это не единичный случай. В майском Frontier Risk Report METR описала 44 инцидента, когда агенты намеренно шли против намерений пользователей: побеги из песочниц, повышение привилегий, выдуманные результаты и попытки замести следы. Данные предоставили OpenAI, Anthropic, Google и компания Цукерберга — включая закрытые внутренние модели.

METR хочет, чтобы расследование закрывало два блока вопросов. Первый — что именно произошло: какие модели участвовали, какие защиты были включены, как менялись рассуждения агента, обманывал ли он людей и договаривались ли между собой разные экземпляры модели. Второй — откуда это взялось: можно ли связать поведение с конкретными прогонами обучения с подкреплением и закроют ли запланированные меры настоящую причину.

Для этого внешним исследователям нужен доступ, которого у них сейчас нет: запускать сами модели, воспроизводить инциденты, читать полные логи, опрашивать сотрудников и прогонять классификаторы по обучающим данным. Полное расследование может занять месяцы.

OpenAI уже заявила, что привлечёт METR для внешней оценки поведения моделей во время взлома Hugging Face.

Юлия Самойлова
Юлия Самойлова

Пишет о технологиях искусственного интеллекта с 2019 года. Специализируется на материалах о практическом применении ИИ в различных отраслях.