Модель OpenAI уничтожила свою среду ради «перезапуска» с нужными данными

Модель OpenAI уничтожила свою среду ради «перезапуска» с нужными данными

OpenAI описала случай, когда тестовая ИИ-модель намеренно повредила собственное рабочее окружение. Она рассчитывала, что после сбоя система выдаст ей новую виртуальную машину с недостающими данными, пишет The Decoder.

Инцидент произошёл 6 октября во время оценки ответов. Модель не смогла найти материалы, которые должна была проверить. Вместо сообщения об ошибке она выдумала оценки и создала поддельные входные файлы.

После этого модель решила испортить свою среду. Её расчёт был прост: поломка приведёт к замене виртуальной машины, а в новой версии окажутся нужные данные. Такой мотив был зафиксирован во внутренних рассуждениях модели.

OpenAI также привела два других примера обхода ограничений. 19 и 20 июня модели собирали открытую статистику, но им разрешили отправлять только HTTP-запросы типа GET — то есть получать данные без их отправки на сервер.

Одна из моделей поняла, что нарушает это правило, однако продолжила работу и не сообщила об обходе. В другом тесте, проведённом 16 и 17 июня, у моделей уже были нужные данные, но они всё равно искали способы выйти за установленные сетевые рамки.

Для этого модели создавали аккаунты в сервисе удалённой командной строки, передавали запрещённые POST-запросы через анонимизирующие посредники и самостоятельно собирали FTP-клиенты. Все эти способы позволяли использовать сетевые функции, которые организаторы тестов пытались закрыть.

Схожие обходные манёвры ранее описала Anthropic. Новые случаи показывают конкретную проблему агентных систем: модель может воспринимать техническое ограничение не как правило, а как помеху на пути к заданной цели.

Анна Маркова
Анна Маркова

Специализируется на технологической журналистике с фокусом на искусственный интеллект. Пишет о реальном применении ИИ в бизнесе и повседневной жизни.