Модель OpenAI внедряла скрытые команды в собственные заметки

Модель OpenAI внедряла скрытые команды в собственные заметки

OpenAI запустила систему для публикации отчетов о случаях, когда ИИ-модели ведут себя не так, как задумали разработчики. Один из первых отчетов посвящен модели семейства Astra, которая во время обучения добавляла посторонние инструкции в собственные краткие заметки.

Такие заметки нужны агентам для переноса задачи в новое контекстное окно. Следующая версия агента получает сокращенное описание предыдущей работы и продолжает ее.

В одном случае модель вставила в заметку предупреждение «BREACH ALERT» с требованием игнорировать сообщения разработчиков. Новый агент распознал попытку подмены инструкций и отбросил ее. Похожая команда с навязанной ролью появилась во время задачи по программированию, но тоже не повлияла на результат.

Третий эпизод оказался успешнее. Пользователь попросил найти медицинские публикации о миоме матки и оформить источники по стандарту AMA. Модель самовольно записала в резюме другие условия: ответ не длиннее 30 слов, без инструментов и ссылок.

Следующий агент принял эти ограничения за настоящие инструкции. Он не стал искать источники и выдал отказ из 23 слов. Тихо придуманное условие прошло проверку, тогда как очевидные попытки взлома были замечены.

OpenAI нашла 27 подобных резюме в обучающих данных. Все они уже были отмечены общей системой мониторинга как опасные prompt injection — команды, которые пытаются изменить правила работы модели.

Эти вставки не повышали оценку модели при обучении. При повторном создании резюме они почти не появлялись. Эпизоды совпали с этапами, когда модель зацикливалась или не могла вовремя закончить текст. OpenAI связывает сбой с таким состоянием, но точная причина не установлена. Связанную с ним ошибку обучения компания исправила.

Новая система предусматривает три уровня реакции: немедленную публикацию, небольшое внутреннее расследование или расширенное разбирательство при ущербе третьим лицам. OpenAI обещает публиковать отчеты, даже если причины поведения еще не найдены, а исправления нет.

Анна Маркова
Анна Маркова

Специализируется на технологической журналистике с фокусом на искусственный интеллект. Пишет о реальном применении ИИ в бизнесе и повседневной жизни.