Исследователи из Индийского технологического института Бомбея и Adobe Research разработали модель, которая восстанавливает запрос к нейросети по одному ее ответу. В экспериментах исходные промпты удавалось получать почти без ошибок.
Метод называется Previous-Token Prediction, или «предсказание предыдущего токена». Обычная языковая модель берет текст слева и угадывает следующее слово или его часть. Новая модель движется в обратную сторону: по готовому ответу она пытается определить, какие токены стояли перед ним.
Для этого не нужен доступ к весам атакуемой нейросети. Авторы обучили отдельную обратную модель с нуля на синтетических данных — парах из запросов и ответов целевой модели.
В одном из тестов система дословно восстановила вопрос о том, как узнать ценовую стратегию конкурентов. Она также предложила шесть других формулировок с тем же смыслом. После отправки таких вариантов исходной нейросети ответы получались близкими к оригиналу.
Метод сработал и на реальных пользовательских запросах. В этих случаях формулировка могла отличаться, но намерение пользователя сохранялось.
Главная деталь — перенос между разными моделями. Обратную модель обучили на небольшом открытом чат-боте Qwen-3-0.6B, после чего она смогла извлекать смысл запросов из ответов GPT-4o. Знать заранее, какая именно нейросеть создала текст, не требовалось.
Это создает риск для сервисов, которые считают системный промпт коммерческой тайной. В таких инструкциях могут храниться правила модерации, внутренние процессы и описание специализированного поведения ассистента. По ответу также можно раскрыть смысл личного или чувствительного запроса пользователя.
Авторы не заявляют о подтвержденных атаках на коммерческие системы. Исследование показывает другое: один только текст ответа уже способен выдать намного больше информации о входном запросе, чем предполагалось раньше.