Китайская Z.ai выпустила открытую модель GLM-5.3-Flash. Она почти догнала старшую GLM-5.3 в тестах, но обработка одного задания обходится примерно в 7,5 раза дешевле.
GLM-5.3-Flash стала первой моделью семейства с мультимодальностью изначально. Она умеет работать с разными типами данных, а не только с текстом. В модели 320 млрд параметров, но при каждом запросе используются лишь 18 млрд. Контекст вмещает до миллиона токенов.
Модель распространяется по лицензии MIT, а её веса опубликованы на Hugging Face. Это позволяет разработчикам запускать и дорабатывать её самостоятельно.
В рейтинге Artificial Analysis модель получила 57 баллов при максимальной глубине рассуждений. У более крупной GLM-5.3 — 60 баллов. Результат GLM-5.3-Flash оказался на уровне GPT-5.6 Terra и Muse Spark 1.2.
Одно задание в тесте стоило в среднем $0,09 против $0,68 у GLM-5.3. Через API Z.ai миллион входных токенов стоит $0,15, а миллион выходных — $0,50. Это чуть больше десятой части цены старшей модели.
На агентном тесте GDPval-AA v2 новинка набрала около 1770 баллов Elo. Это уровень GLM-5.3 и Grok 4.6. Выше оказался только Claude Opus 5. При этом модель расходует токены неэкономно: около 90% её вывода в тестах Artificial Analysis приходилось на рассуждения.
Перед релизом Z.ai анонимно испытывала модель под названием ox-alpha в OpenCode и OpenRouter. За неделю она стала там самой популярной. По данным компании, весь поток запросов обрабатывали китайские ИИ-чипы, без оборудования Nvidia.
SemiAnalysis сообщает, что инфраструктура обслуживала до 100 трлн токенов в сутки. Z.ai построила систему на базе SGLang и разделила обработку на независимо масштабируемые этапы. Это утроило пропускную способность на том же оборудовании.
GLM-5.3-Flash показывает, что дешёвый массовый инференс моделей высокого класса уже можно строить вне экосистемы Nvidia и CUDA.