Китайская компания Z.AI призналась в авторстве модели Ox Alpha, которая в конце августа внезапно вырвалась на первое место по популярности среди решений на OpenRouter. Загадочный продукт получил официальное имя GLM-5.3-Flash.
Разработчик подаёт его как доступный инструмент для написания кода и работы автономных ИИ-агентов, способный по ряду задач приблизиться к куда более дорогой Claude Opus 4.8.
На OpenRouter модель возникла без имени создателя, после чего за считанные дни обошла известных конкурентов и стала самым востребованным решением недели. До раскрытия личности разработчика Ox Alpha успела привлечь более 503 тыс. уникальных пользователей и прогнать через OpenCode свыше 44 трлн токенов. В Z.AI позже пояснили, что анонимная вывеска была частью закрытого испытания, во время которого компания собирала пользовательские отзывы перед полноценным представлением продукта.
GLM-5.3-Flash умеет воспринимать изображения и видео, что превращает её скорее в универсального цифрового помощника, чем в очередную модель для генерации текста. Но настоящая интрига прячется не в количестве поддерживаемых форматов, а в ценнике.
Z.AI собирается брать всего $0,15 за миллион входных токенов и $0,50 за миллион выходных. На этом месте калькулятор у конкурентов может слегка загрустить. Для сравнения, у Anthropic модель Claude Haiku 4.5 обходится в $1 за миллион входных токенов и $5 за миллион выходных. Разница выходит заметной, прежде всего для разработчиков, которые гоняют через ИИ огромные объёмы запросов.
Z.AI утверждает, что GLM-5.3-Flash заметно обходит предыдущую GLM-5.2 в тестах, связанных с программированием и автономными агентами, а по отдельным результатам уже приближается к Claude Opus 4.8. В тесте DeepSWE v1.1 новая версия получила 63,4 балла против 46,2 у GLM-5.2.
Внутри GLM-5.3-Flash находится 320 млрд параметров, но во время конкретного запроса активными оказываются лишь около 18 млрд. Это позволяет не гонять весь гигантский массив вычислений при каждом обращении к модели и заметно экономить ресурсы.
Архитектура построена на комбинации разреженного и линейного внимания. Она хорошо помогает при работе с длинными контекстами, где обычная обработка способна быстро превратить вычислительные мощности в печку для серверной. В сравнении с GLM-5.3 новая модель примерно втрое уменьшает объём вычислений для механизма внимания, а потребность в памяти для промежуточных данных при обработке контекста сокращается примерно в 4,4 раза.
GLM-5.3-Flash не просто разработали в Китае, но и проверяли её работу на китайских ускорителях. В Z.AI заявили, что весь трафик, проходивший через анонимную Ox Alpha во время испытаний, обслуживало отечественное вычислительное оборудование. Для этого компания создала собственную инфраструктуру, рассчитанную на работу с китайскими ИИ-чипами. После оптимизации производительность системы, по оценке разработчика, удалось примерно утроить относительно исходной конфигурации. Получается любопытная конструкция, где одновременно оптимизируется сама нейросеть и железо, на котором она крутится.
Z.AI открыла веса GLM-5.3-Flash, поэтому сторонние разработчики получают возможность самостоятельно запускать модель, изучать её устройство и подстраивать под собственные продукты. Для локальных серверов, корпоративных решений и специализированных ИИ-сервисов это может оказаться привлекательным вариантом.