Claude Sonnet 5.5 почти догнал флагман Anthropic и ускорил генерацию на 30%

Claude Sonnet 5.5 почти догнал флагман Anthropic и ускорил генерацию на 30%

Anthropic выпустила Claude Sonnet 5.5 — модель для повседневной работы с кодом, документами, презентациями и таблицами. По данным компании, она генерирует ответы более чем на 30% быстрее предшественницы, а выполнение одной задачи обходится дешевле на величину до 30%.

Самый заметный прирост связан с программированием. В тесте для автономных ИИ-разработчиков Terminal-Bench 4.0 новая модель набрала 70,6% против 10,3% у Sonnet 5. На CursorBench 4.0 результат вырос с 34,1% до 55,5%. Это лишь на 2,3 процентного пункта меньше показателя флагманской Opus 5.5.

В задачах умственного труда разница почти исчезла. На разработанном OpenAI тесте GDPval-AA, который охватывает 44 профессии и девять отраслей, Sonnet 5.5 получила 1844 балла. У Opus 5.5 — 1846, а у прежней Sonnet 5 — 1449.

При максимальной глубине рассуждений модель не всегда работает лучше. В тесте FrontierCode режим Max дал 46,2%, а менее затратный Xhigh — 52,1%. Anthropic объясняет это тем, что Max чаще подключает несколько ИИ-агентов для проверки кода. Они иногда не укладываются во время или вносят изменения за пределами задания.

Тарифы за миллион токенов не изменились: $2 за ввод, $10 за вывод и $0,20 за чтение кеша. Экономия на задаче возникает за счет меньшего расхода токенов. Независимые тесты скорости и стоимости пока не опубликованы.

Claude Sonnet 5.5 уже доступна через платформу Anthropic, AWS, Google Cloud и Microsoft Azure под идентификатором claude-sonnet-5-5. Опасные запросы по кибербезопасности будут перенаправляться на менее мощную Sonnet 5. В ближайшие недели компания также планирует выпустить бюджетную Claude Haiku 5.5.

Ирина Задорожная
Ирина Задорожная

Журналист с опытом работы в оффлайн-медиа и онлайн-изданиях. Пишу про искусственный интеллект, ИТ-системы и сервисы, про ИТ-бизнес уже 10 лет.