Агент NVIDIA прошёл ARC-AGI-3 на 100% — та же Claude Opus 5 в отдельном тестировании набрала около 30%

Агент NVIDIA прошёл ARC-AGI-3 на 100% — та же Claude Opus 5 в отдельном тестировании набрала около 30%

NVIDIA сообщила, что её агентная система Agentic Variation Operators (AVO) получила 100% на публичном наборе ARC-AGI-3. В основе агента работала модель Claude Opus 5.

ARC-AGI-3 проверяет, как ИИ действует в незнакомой среде. Агенту нужно изучать правила игр по ходу прохождения, пробовать разные решения и учитывать результаты предыдущих действий.

В бенчмарке используется метрика Relative Human Action Efficiency, или RHAE. Она учитывает не только сам факт прохождения, но и число действий по сравнению с человеком, который впервые видит ту же игру. Для результата 100% нужно пройти все задания с эффективностью не ниже человеческой.

AVO справилась со всеми 183 уровнями публичного набора. При этом в отдельном тестировании ARC Prize, создателя ARC-AGI-3, та же базовая модель Claude Opus 5 получила около 30% RHAE. Условия двух оценок отличались, поэтому результаты показывают не прямое превосходство, а влияние системы вокруг модели.

Такая система называется исполнительной средой, или harness. Она хранит историю попыток, управляет инструментами и состоянием задачи, а также помогает агенту восстановиться после ошибки. AVO использует постоянную память и отдельный механизм контроля, который меняет подход, если работа зашла в тупик. Основной агент многократно оценивает ситуацию, составляет план, действует и проверяет результат.

Изначально NVIDIA создавала AVO для оптимизации программного кода под графические процессоры. Для ARC-AGI-3 компания сохранила основную архитектуру и добавила интерфейс управления играми.

По данным NVIDIA, нужна проверка на более широком наборе моделей, чтобы установить, сохраняется ли выявленная роль исполнительной среды и для них. Эксперимент показывает: в долгих автономных задачах итоговый балл зависит не только от базовой модели, но и от памяти, инструментов, обратной связи и обработки неудачных попыток.

Александр Чернов
Александр Чернов

Журналист с техническим бэкграундом, пишущий о практических аспектах внедрения искусственного интеллекта. Бывший главред федерального издания. Любит сбалансированную подачу информации без хайпа.