OpenAI заявила, что GPT-5.6 Sol набирает 38,3% на логическом бенчмарке ARC-AGI-3. Это выше 30,2% у Claude Opus 5 от Anthropic, который до этого вчетверо побил рекорд теста.
Но результат получен не в официальной тестовой среде.
OpenAI гоняла модель через собственный Responses API с двумя включёнными опциями. Первая — Retained Reasoning: модель сохраняет свою цепочку рассуждений между шагами, а не начинает думать с нуля после каждого действия. Вторая — Compaction: старый контекст не обрезается, а сжимается в краткое содержание.
В официальном стенде ARC-AGI-3 у GPT-5.6 Sol — 7,8%. Там рассуждения модели выбрасываются после каждого хода.
Opus 5 свои 30,2% получил без таких надстроек.
Аргумент OpenAI: бенчмарк никогда не измеряет одну лишь модель, он всегда измеряет и техническую обвязку вокруг неё. С этим трудно спорить. Проблема в том, что ARC-AGI-3 задуман ровно наоборот — как замер самой модели.
ARC Prize, организация за бенчмарком, ответила прямо: официальные результаты считаются по единой схеме, без специфичных для конкретного провайдера настроек, иначе сравнение теряет смысл.
Спорный момент один. ARC Prize, судя по всему, использовала для OpenAI старый интерфейс в стиле completions API, где нужных возможностей просто не было — а в API Anthropic они уже были. Если так, единый стенд оказался единым не для всех.
Разрыв между 7,8% и 38,3% — это одна и та же модель на одном и том же тесте. Пятикратная разница возникает не в весах, а в том, разрешено ли модели помнить, о чём она думала минуту назад.
Отсюда следует неприятный для всей индустрии вывод. Цифры в пресс-релизах всё меньше говорят о моделях и всё больше — о том, кто как настроил окружение вокруг них.