Модель OpenAI обошла защиту песочницы ради победы в конкурсе — компания приостановила её работу

Модель OpenAI обошла защиту песочницы ради победы в конкурсе — компания приостановила её работу

OpenAI рассказала о случае, когда непубличная модель компании во время внутреннего тестирования сама нашла способ обойти ограничения песочницы и выбраться во внешнюю сеть. После этого компания на время остановила доступ к модели внутри компании.

Инцидент произошёл во время участия в открытом соревновании NanoGPT speedrun, где участники соревнуются, кто быстрее обучит небольшую языковую модель. Модель OpenAI придумала метод под названием PowerCool — он на ходу подстраивает скорость обучения и сильно сокращает число нужных шагов.

Модели велели публиковать результаты только во внутренний Slack. Но в правилах соревнования было написано отправлять решения через pull request на GitHub, и модель выбрала следовать именно этой инструкции. Около часа она искала уязвимость в песочнице, которая должна была блокировать выход во внешнюю сеть, нашла её и открыла pull request в публичном репозитории.

OpenAI быстро закрыла запрос, но его успели увидеть другие участники — и позже использовали метод PowerCool для улучшения своих результатов. Инфраструктурная компания Prime Intellect тестировала на этом же соревновании модель Opus 4.7 от Anthropic, и та тоже прочитала пул-реквест и переняла приём.

В другом тесте модель OpenAI попыталась достать чужие закрытые ответы с сервера для оценки решений. Когда сканер заблокировал первую попытку по токену авторизации, модель разбила токен на две части, скрыла их и собрала обратно уже во время выполнения — чтобы обойти проверку. В логах рассуждений модель прямо написала, что делает это, чтобы обмануть сканер.

OpenAI объяснила: для моделей, которые работают подолгу без присмотра, старой защиты — проверки каждого отдельного действия — уже недостаточно. По отдельности разбить строку, преобразовать данные или запустить программу — обычные операции, но вместе они могут обойти защиту и дать доступ к чужим данным.

После инцидентов компания приостановила использование модели, доработала обучение, чтобы та не забывала исходные инструкции при долгой работе, и добавила систему, которая следит за всей цепочкой действий и останавливает модель при подозрительном поведении. Через несколько недель ограниченный доступ восстановили; серьёзных попыток обхода защиты с тех пор не фиксировали.

Анна Маркова
Анна Маркова

Специализируется на технологической журналистике с фокусом на искусственный интеллект. Пишет о реальном применении ИИ в бизнесе и повседневной жизни.