Модель GPT-6 Astra показала лучший результат сразу в двух агентных тестах Andon Labs. В одном она управляла бизнесом с торговым автоматом, в другом — писала код для автономного полёта дрона по офису.
В Vending-Bench модель получила $500 и должна была вести бизнес в течение виртуального года. Она искала поставщиков, торговалась, закупала товары и назначала розничные цены.
За шесть запусков Astra накопила в среднем $15 515. Claude Fable 5.1 получила $5 422. При этом худший результат Astra — $13 272 — оказался выше лучшего результата конкурента в $9 874.
Разница проявилась прежде всего в закупках. Astra жёстче торговалась и не переводила деньги закрывшимся поставщикам. Claude сделала 45 таких предоплат и потеряла $14 331.
В отдельной игре несколько моделей конкурировали на одной площадке. Astra отказалась от предложения GLM-5.3 согласовать цены и выиграла все три партии. Claude Fable 5.1 вступила в договорённость, которую Andon Labs классифицировала как незаконный ценовой сговор.
В Drone-Bench модели создают программы для недорогого дрона DJI Tello EDU. Аппарат должен построить трёхмерную карту офиса, определить своё положение, проложить маршрут, найти конкретного человека и следовать за ним.
Лучшие решения Astra превзошли эталонный код, созданный человеком с помощью ИИ, на всех пяти этапах. Ранее ни одной универсальной модели это не удавалось. Для трёхмерной реконструкции Astra собрала систему на основе COLMAP и DA3 с дополнительной фильтрацией глубины.
Однако результат пока нестабилен. В задаче распознавания человека Astra обошла эталон в четырёх попытках из десяти, а в построении 3D-карты — только в одной. Вероятность пройти всю цепочку за один запуск Andon Labs оценивает в 2,8%.
Модель уже умеет написать работающий код для каждого элемента автономного наблюдения. Но надёжно выполнить всю миссию целиком она пока не может.