OpenAI заблокировала сеть из более чем 15 тысяч аккаунтов, которые пытались извлекать скрытые рассуждения ее моделей. Однако аналогичная атака еще несколько недель работала через Microsoft Azure — даже с новой GPT-6 Astra.
Активность началась 1 июля. Пик пришелся на 24–25 июля: более четырех тысяч пользователей отправили около 16 тысяч запросов по одной схеме. К 28 июля OpenAI отключила всю обнаруженную сеть. Компания подчеркивает, что речь идет о попытках извлечения: успешность каждой из них не подтверждена.
OpenAI связала основную группу участников с людьми, имеющими отношение к Moonshot AI — разработчику языковой модели Kimi. При этом компания не утверждает, что все аккаунты управлялись из одного источника.
Атака использовала зашифрованные пакеты с рассуждениями модели. Такие пакеты нужны для продолжения диалога, но их можно было переносить между сессиями, пользователями и моделями одного поставщика. Более дешевая модель получала пакет от мощной модели и дословно раскрывала его содержимое.
OpenAI заблокировала подозрительные аккаунты, ужесточила регистрацию и ограничила повторное использование чужих пакетов. Компания также начала проверять потоковые ответы и задерживать выдачу, если в ней могли оказаться скрытые рассуждения.
Но защита собственного API не закрыла тот же путь у облачных партнеров. Команда исследователя Йоахима Шеффера 13 сентября повторила эксперимент в Azure. Атака сработала на всех проверенных моделях OpenAI, включая GPT-6 Astra, и на моделях Anthropic вплоть до Sonnet 5. Для извлечения рассуждений хватало одного запроса.
Исследователи нашли и более простой вариант: модели давали виртуальный блокнот и просили записывать туда ход решения. Метод сработал на всех проверенных моделях OpenAI, а также на Opus 4.8 и Sonnet 5.
По данным исследователей, OpenAI добавила защиту в Azure только 27 сентября. Извлечение из моделей Anthropic перестало воспроизводиться там 28 сентября. Один и тот же ИИ оказался защищен по-разному в зависимости от площадки, через которую к нему обращались.