GLM-5.3-Flash: Z.ai раскрыл Ox Alpha и выложил веса

GLM-5.3-Flash: Z.ai раскрыл Ox Alpha и выложил веса
26 августа 2026 китайская Z.ai (Zhipu) официально признала, что stealth-модель Ox Alpha, которая неделю рвала лидерборд OpenRouter, - это GLM-5.3-Flash. В тот же день веса выложили на HuggingFace под MIT-лицензией. Модель на 320 млрд параметров MoE (18B активных), контекст 1 048 576 токенов, мультимодальный вход (текст, картинки, видео). На OpenRouter стоит $0.075 за миллион входных токенов и $0.25 за выходные - это в 66 раз дешевле Claude Opus 4.8 по инпуту и в 100 раз по аутпуту. Бесплатный чат - на chat.z.ai.
Что за модель и почему шум
20 августа на OpenRouter появилась Ox Alpha от анонимного провайдера Stealth. За шесть дней модель прогнала 42 триллиона токенов пользователей и вылезла в топ лидерборда - в первую очередь потому, что была бесплатной и держала 1M контекста. Пока Ox Alpha молчал об авторстве, сообщество разбирало токенизатор и голосовало за китайское происхождение.
26 августа Z.ai подтвердил догадку: Ox Alpha - это GLM-5.3-Flash, следующая итерация линейки GLM после релиза базовой GLM-5.3 (14 августа 2026). Веса тут же выложили публично, работать с моделью можно четырьмя способами: чат на chat.z.ai, API Z.ai, OpenRouter, локально через vLLM.
Характеристики GLM-5.3-Flash
| Параметр | Значение |
|---|---|
| Архитектура | Mixture-of-Experts, 320B параметров, 18B активных |
| Контекст | 1 048 576 токенов (1M) |
| Модальности вход | текст, изображения, видео |
| Модальности выход | текст |
| Лицензия | MIT (можно коммерческое использование) |
| Function calling | да (tools, tool_choice) |
| JSON-режим | response_format без schema-валидации |
| Веса | zai-org/GLM-5.3-Flash и GLM-5.3-Flash-BF16 |
| Позиционирование | reasoning-модель под кодинг и агентные задачи |
MoE-архитектура означает: на каждом токене работают не все 320 миллиардов параметров, а только 18 миллиардов активных экспертов. Это то, что позволяет крутить огромную модель за копейки - активная часть меньше, чем у плотных 70B-моделей.
Сравнение с Claude Opus 4.8
Самое интересное - цена против качества. Claude Opus 4.8 (релиз 28 мая 2026) - текущий фронтир Anthropic на кодинге, $5 за миллион входных токенов и $25 за выходные.
| Метрика | GLM-5.3-Flash (OpenRouter) | Claude Opus 4.8 |
|---|---|---|
| Цена, input | $0.075 / 1M токенов | $5 / 1M токенов |
| Цена, output | $0.25 / 1M токенов | $25 / 1M токенов |
| Контекст | 1M | 200K |
| Terminal-Bench 2.1 | 84.3 | 85.0 |
| Z.ai Code Bench (High effort) | 31.4% | 29.5% |
| Токенов на задачу (Code Bench) | ~50 000 | ~120 000 |
| Лицензия весов | MIT (открытые) | закрытая, API-only |
По Z.ai Code Bench GLM-5.3-Flash тратит в 2.4 раза меньше выходных токенов на ту же задачу, чем Opus 4.8. Это отдельно бьёт по счёту в проде: не только цена за токен ниже, но и токенов на задачу нужно меньше.
Честная оговорка: Z.ai Code Bench - собственный бенчмарк Zhipu. Terminal-Bench 2.1 нейтральнее. На большинстве публичных SWE-бенчей Opus 4.8 всё ещё берёт верх, но с разрывом в 2-5 процентных пункта - а не в разы, как раньше.
Как попробовать бесплатно
Самый быстрый путь - открыть chat.z.ai и написать в чат. Регистрация по email, никаких карт. Модель выбирается сверху, GLM-5.3-Flash - дефолтная. Работает без VPN из РФ (проверил 26 августа с домашнего интернета в Москве).
Для API нужна регистрация на z.ai или OpenRouter. На OpenRouter проще - один ключ на все модели, оплата в долларах, минимальный порог $10. Модель ID на OpenRouter: z-ai/glm-5.3-flash.
Минимальный запрос через curl:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3-flash",
"messages": [{"role": "user", "content": "Отрефактори этот код: ..."}]
}'
Как подключить GLM-5.3-Flash в Claude Code
Claude Code ходит только в API Anthropic. Прямо переключить провайдера нельзя, но можно поставить прокси, который принимает Anthropic-формат и переводит в OpenAI-совместимый OpenRouter. Самое стабильное - claude-code-router (гуглится по названию, MIT).
Если не хочется возиться с прокси, готовый запрос для Claude Code, который сам разберётся:
В Claude Code вставь запрос: подключи ко мне GLM-5.3-Flash через OpenRouter
как дополнительного провайдера в claude-code-router. Мой ключ OpenRouter
в .env как OPENROUTER_API_KEY. Модель на OpenRouter называется
z-ai/glm-5.3-flash. Настрой роутинг: длинные задачи (>50k токенов контекста)
и агентные пайплайны идут в GLM-5.3-Flash, короткие ответы и уточнения -
в Claude Sonnet. Покажи мне итоговый конфиг.
Это честнее, чем вручную ковырять конфиги. Плюс роутер будет выбирать провайдера по типу задачи, а не переключать модель руками.
Как поставить локально или на своём сервере
Веса на HuggingFace: zai-org/GLM-5.3-Flash (стандартный формат) и zai-org/GLM-5.3-Flash-BF16 (для BF16-инференса). 320B параметров - это ~640 ГБ VRAM в FP16 без квантизации. Для домашнего железа нереально, для одиночной H100 - тоже нет.
Реалистичный вариант локального инференса - квантизация до 4-битной GGUF (через llama.cpp) или запуск на кластере из 8x A100 через vLLM.
Запуск с vLLM (нужен кластер или облако):
pip install -U "huggingface_hub[cli]" vllm
huggingface-cli download zai-org/GLM-5.3-Flash --local-dir ./glm-5.3-flash
vllm serve ./glm-5.3-flash --tensor-parallel-size 8 --max-model-len 1048576
На выходе - OpenAI-совместимый эндпоинт на localhost:8000/v1. Дальше подключаете любой OpenRouter-клиент, только меняете base_url на свой сервер.
Для большинства проектов держать локально невыгодно - через OpenRouter получается дешевле, чем платить за GPU-хостинг.
Стоит ли переносить прод с Claude или GPT
Мой ответ на 26 августа: для типового кода и рефакторинга - да, для критических агентных пайплайнов - подождать.
Плюсы, за что реально можно переходить:
- Цена. В 66 раз дешевле Opus 4.8 по инпуту - это не оптимизация, это переопределение экономики.
- Контекст 1M. Влезает средний репозиторий целиком, не нужно резать чанками.
- MIT-лицензия. Можно ставить локально, никаких платежей за токены на закрытых контурах.
Минусы, из-за чего не всё сразу:
- Модель свежая, продовые кейсы ещё не собраны. Первая неделя релиза - не время тащить в критичные пайплайны.
- Провайдерская инфраструктура Z.ai пока молодая. OpenRouter стабильнее, но добавляет прослойку.
- На сложных SWE-задачах Opus 4.8 всё ещё чуть точнее. Разрыв небольшой, но в проде решает.
Практика на неделю: возьмите один рабочий пайплайн, где Claude Sonnet справляется, и параллельно прогоните через GLM-5.3-Flash. Сравните руками - скорость, качество, счёт. Через 5-7 прогонов будет видно, куда двигать.
FAQ
Где смотреть, что модель точно от Z.ai, а не подделка? Официальный анонс - в блоге z.ai и на HuggingFace от zai-org. Веса подписаны, есть исходный technical report на arxiv (2508.06471). Если качаете не с zai-org - это уже не оригинал.
Правда, что в 10 раз дешевле GPT и Claude? Бекдор в анонсе занизил: на OpenRouter GLM-5.3-Flash в 66 раз дешевле Claude Opus 4.8 по инпуту и в 100 раз по аутпуту. Против базовой GLM-5.3 разница поменьше (в 5-10 раз), это тоже правда.
Мультимодальность работает или это маркетинг? Вход - реально текст+картинки+видео. Выход - только текст (не генерирует изображения). Для разбора скриншотов, схем, коротких видео - работает. Проверено в chat.z.ai.
Что с приватностью, если гоняю через chat.z.ai? Z.ai - китайская компания, юрисдикция КНР. Персональные данные клиентов, коммерческие тайны и любые чувствительные документы туда лить не стоит. Для открытого кода, пет-проектов и обучающих задач - ок.
Есть ли смысл дожидаться GLM-5.3 (не Flash)? Базовая GLM-5.3 существует с 14 августа, но её нет в открытом доступе как весов. Flash - это уменьшенная и удешевлённая версия, и на публичных бенчах она даёт 90%+ качества от старшей. Ждать полную не обязательно.
Вывод
GLM-5.3-Flash - первый случай, когда открытая модель под MIT реально давит фронтир Anthropic по деньгам, а не по маркетингу. 320B параметров MoE, 1M контекст, мультимодальный вход, доступна четырьмя способами - от бесплатного чата до локального инференса. По кодингу - в 2-5 пунктах от Claude Opus 4.8 на большинстве бенчей, при этом в 66 раз дешевле по инпуту.
Что делать на этой неделе: 1) открыть chat.z.ai и погонять в чате на своих задачах, 2) сгенерить ключ OpenRouter и подключить z-ai/glm-5.3-flash в свой рабочий редактор, 3) параллельно прогнать один рабочий пайплайн через GLM и через Claude - сравнить руками. Через неделю решение по проду примется само.
Напоминаю, что stealth-версия Ox Alpha сама по себе разбиралась в отдельной статье: Ox Alpha на OpenRouter - там подробнее про историю релиза и первые тесты, когда авторство ещё не подтвердили. Про использование GLM в редакторе с телефона тоже есть - zcode: GLM для вайбкодинга.
Что дальше
Если хочешь собрать такую систему у себя - у меня есть курс по вайбкодингу и работе с нейросетями в клубе Мандарин Лаб: mandarinedu.ru. Первые уроки открыты бесплатно.
Если нужно внедрить ИИ в бизнес - процессы, агентов, автоматизацию под вашу задачу - пишите мне напрямую: t.me/Philigranchik. Разберу задачу и скажу, что реально автоматизируется, а что нет.

Вайбкодер-разработчик и маркетолог с 9-летним опытом, основатель «Мандарин Лаб». Собирает на ИИ то, за что раньше платили подрядчикам сотни тысяч: CRM, ботов, автоматизации, монтаж. Одну из систем строил под агентство недвижимости с базой в 400 000 лидов. Теперь учит этому с нуля - как за вечер собрать свой инструмент через Claude Code и зарабатывать на нейросетях.
Telegram @mike_cmo →Кто такой Михаил Иванин →