Claude Opus 5 почти учетверил рекорд на тесте настоящего интеллекта ARC-AGI-3

Claude Opus 5 почти учетверил рекорд на тесте настоящего интеллекта ARC-AGI-3

Новая модель Anthropic Claude Opus 5 набрала 30,2% на бенчмарке ARC-AGI-3. Предыдущий рекорд — 7,8% — принадлежал модели OpenAI GPT-5.6 Sol (Max).

ARC-AGI-3 проверяет не память, а умение рассуждать. Модели дают незнакомую игровую среду: она должна сама понять правила, спланировать действия и выполнить их шаг за шагом — без предварительного обучения на этой задаче.

Opus 5 решил пять сред, которые раньше не поддавались никому, причём четыре — на уровне человека или выше. Модель обошла даже другие модели Anthropic класса Fable, которые останавливались на 20%.

Разработчики теста из ARC Prize отмечают необычное поведение: во время решения задач Opus 5 самостоятельно перевёл условия в алгебраическую форму и вывел уравнения отражения. Раньше такого не делала ни одна модель. Авторы бенчмарка связывают это с более сильной логикой, которая помогает модели исследовать незнакомую среду и строить план действий самостоятельно.

На старых версиях теста Opus 5 тоже повторил лучший результат: 90,4% на ARC-AGI-2 и 97,5% на ARC-AGI-1 — на уровне прежних лидеров, но с более высокими затратами вычислений.

Anthropic не объяснила причину скачка. В компании могли разметить данные под формат конкретных головоломок и обучить модель через reinforcement learning — поощряя исследование среды, планирование и исправление ошибок. Opus 5 создавался уже после публикации ARC-AGI-3, так что у Anthropic было время подстроиться под формат теста.

Независимая проверка на другом тесте — Witness разработчика Гуанхань Нин — картину смягчает. Там Opus 5 набрал 43,4 балла, статистически на уровне моделей Kimi K3 и Fable 5, и улучшился по сравнению с Opus 4.8 гораздо слабее, чем на ARC-AGI-3. На игре с непривычной механикой Opus 5 даже уступил предыдущей версии.

Грег Камрадт, один из создателей ARC-AGI-3, считает, что это не отменяет общего прогресса модели: один слабый результат без детальной статистики ничего не доказывает. Нин добавил, что перенос навыков всё же есть — просто слабее, чем на основном тесте. Он сравнил ситуацию с тем, как раньше развивались тесты для кода: сначала модели натаскивают на главный бенчмарк, а обобщение на смежные задачи приходит позже.

Ирина Задорожная
Ирина Задорожная

Журналист с опытом работы в оффлайн-медиа и онлайн-изданиях. Пишу про искусственный интеллект, ИТ-системы и сервисы, про ИТ-бизнес уже 10 лет.