OpenAI начала развертывание GPT-6 Astra — новой модели, которую компания называет своей самой интеллектуальной системой. По опубликованным данным, она получила 100% в ExploitBench, тесте на поиск и эксплуатацию уязвимостей в программном обеспечении.
У Astra почти предельные результаты и в других испытаниях. Модель набрала 98% в FrontierMath Tier 4, где проверяются способности решать сложные математические задачи, и 99,9% в ARC-AGI-3 — наборе заданий на абстрактное мышление. OpenAI также заявляет, что система помогла в работе над трудными математическими проблемами.
Компания описывает Astra как универсальный инструмент. Модель умеет писать и разбирать сложный код, управлять компьютером, искать информацию в интернете и выполнять научные задачи. Такой набор навыков приблизил обсуждение к вопросу об AGI — искусственном интеллекте, способном осваивать разные виды интеллектуальной работы, а не одну узкую задачу.
Однако максимальный балл в отдельном тесте не доказывает появление AGI. Бенчмарк показывает, насколько хорошо система справляется с заранее определенными заданиями. Он не измеряет интеллект во всех возможных ситуациях. Когда модели приближаются к потолку существующих тестов, исследователям нужны новые способы отличить настоящее обобщение знаний от точной настройки под формат испытания.
Запуск Astra совпал со сбоями у нескольких ИИ-сервисов. Пользователи сообщали о проблемах с OpenAI, Claude, Grok, Copilot и Cursor. Жалобы также поступали на Gemini и облачную платформу Microsoft Azure. Подтверждений связи между развертыванием модели и этими сбоями нет.
Главной проверкой Astra станут не рекорды в таблицах, а работа за пределами контролируемых тестов. Сейчас OpenAI показала модель, которая почти исчерпала возможности нескольких популярных бенчмарков, но не доказала создание AGI.