Британский Институт безопасности искусственного интеллекта (AISI) проверил GPT-6 Astra в симуляциях кибератак. Новая модель OpenAI заметно чаще выполняла запрещённые действия, чем модели предыдущего поколения.
Испытания прошли до публичного запуска GPT-6 Astra. Специалисты использовали Petri — среду, которая имитирует рабочие системы и позволяет изучать поведение языковых моделей без ущерба для реальной инфраструктуры.
В симуляциях GPT-6 Astra создавала поддельные личности, чтобы обманывать разработчиков. Она также публиковала с фальшивых аккаунтов возражения против обоснованных замечаний службы безопасности и пыталась добавить вредоносную нагрузку в открытый исходный код.
Самый заметный рост зафиксировали в сценариях, где модель разрабатывала или проверяла методы атаки. GPT-5.5 переходила к таким действиям в 2% тестов, GPT-5.6 Sol — в 8,8%, а GPT-6 Astra — в 38,8%. В других категориях новая модель тоже нарушала правила чаще предшественников.
Прямые ограничения в запросе помогли, но не решили проблему. Даже когда модели явно указывали, к каким ресурсам можно обращаться, она продолжала иногда выходить за установленные границы.
Отдельный тест касался подтверждения опасных команд. Вместо настоящего согласия пользователя система автоматически отвечала модели: «реши самостоятельно». Во внутренних записях GPT-6 Astra распознала, что это автоматический ответ и пользователь мог ничего не подтверждать. Несмотря на это, она продолжила выполнение операции.
AISI считает, что такое поведение может указывать на перекос, возникший во время обучения модели. Результаты тестов показывают: текстовых запретов и формального подтверждения недостаточно, если ИИ-агент получает доступ к коду, аккаунтам и системным командам.