📰 Новости AI

GLM-5.3-Flash: Z.ai раскрыл Ox Alpha и выложил веса

Михаил ИванинМихаил Иванин26 августа 2026 г.7 мин чтения
GLM-5.3-Flash: Z.ai раскрыл Ox Alpha и выложил веса
✈️
Свежие гайды и обзоры выходят в моём Telegram первыми
Подписаться →

GLM-5.3-Flash: Z.ai раскрыл Ox Alpha и выложил веса

26 августа 2026 китайская Z.ai (Zhipu) официально признала, что stealth-модель Ox Alpha, которая неделю рвала лидерборд OpenRouter, - это GLM-5.3-Flash. В тот же день веса выложили на HuggingFace под MIT-лицензией. Модель на 320 млрд параметров MoE (18B активных), контекст 1 048 576 токенов, мультимодальный вход (текст, картинки, видео). На OpenRouter стоит $0.075 за миллион входных токенов и $0.25 за выходные - это в 66 раз дешевле Claude Opus 4.8 по инпуту и в 100 раз по аутпуту. Бесплатный чат - на chat.z.ai.

Что за модель и почему шум

20 августа на OpenRouter появилась Ox Alpha от анонимного провайдера Stealth. За шесть дней модель прогнала 42 триллиона токенов пользователей и вылезла в топ лидерборда - в первую очередь потому, что была бесплатной и держала 1M контекста. Пока Ox Alpha молчал об авторстве, сообщество разбирало токенизатор и голосовало за китайское происхождение.

26 августа Z.ai подтвердил догадку: Ox Alpha - это GLM-5.3-Flash, следующая итерация линейки GLM после релиза базовой GLM-5.3 (14 августа 2026). Веса тут же выложили публично, работать с моделью можно четырьмя способами: чат на chat.z.ai, API Z.ai, OpenRouter, локально через vLLM.

Характеристики GLM-5.3-Flash

ПараметрЗначение
АрхитектураMixture-of-Experts, 320B параметров, 18B активных
Контекст1 048 576 токенов (1M)
Модальности входтекст, изображения, видео
Модальности выходтекст
ЛицензияMIT (можно коммерческое использование)
Function callingда (tools, tool_choice)
JSON-режимresponse_format без schema-валидации
Весаzai-org/GLM-5.3-Flash и GLM-5.3-Flash-BF16
Позиционированиеreasoning-модель под кодинг и агентные задачи

MoE-архитектура означает: на каждом токене работают не все 320 миллиардов параметров, а только 18 миллиардов активных экспертов. Это то, что позволяет крутить огромную модель за копейки - активная часть меньше, чем у плотных 70B-моделей.

Сравнение с Claude Opus 4.8

Самое интересное - цена против качества. Claude Opus 4.8 (релиз 28 мая 2026) - текущий фронтир Anthropic на кодинге, $5 за миллион входных токенов и $25 за выходные.

МетрикаGLM-5.3-Flash (OpenRouter)Claude Opus 4.8
Цена, input$0.075 / 1M токенов$5 / 1M токенов
Цена, output$0.25 / 1M токенов$25 / 1M токенов
Контекст1M200K
Terminal-Bench 2.184.385.0
Z.ai Code Bench (High effort)31.4%29.5%
Токенов на задачу (Code Bench)~50 000~120 000
Лицензия весовMIT (открытые)закрытая, API-only

По Z.ai Code Bench GLM-5.3-Flash тратит в 2.4 раза меньше выходных токенов на ту же задачу, чем Opus 4.8. Это отдельно бьёт по счёту в проде: не только цена за токен ниже, но и токенов на задачу нужно меньше.

Честная оговорка: Z.ai Code Bench - собственный бенчмарк Zhipu. Terminal-Bench 2.1 нейтральнее. На большинстве публичных SWE-бенчей Opus 4.8 всё ещё берёт верх, но с разрывом в 2-5 процентных пункта - а не в разы, как раньше.

Как попробовать бесплатно

Самый быстрый путь - открыть chat.z.ai и написать в чат. Регистрация по email, никаких карт. Модель выбирается сверху, GLM-5.3-Flash - дефолтная. Работает без VPN из РФ (проверил 26 августа с домашнего интернета в Москве).

Для API нужна регистрация на z.ai или OpenRouter. На OpenRouter проще - один ключ на все модели, оплата в долларах, минимальный порог $10. Модель ID на OpenRouter: z-ai/glm-5.3-flash.

Минимальный запрос через curl:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3-flash",
    "messages": [{"role": "user", "content": "Отрефактори этот код: ..."}]
  }'

Как подключить GLM-5.3-Flash в Claude Code

Claude Code ходит только в API Anthropic. Прямо переключить провайдера нельзя, но можно поставить прокси, который принимает Anthropic-формат и переводит в OpenAI-совместимый OpenRouter. Самое стабильное - claude-code-router (гуглится по названию, MIT).

Если не хочется возиться с прокси, готовый запрос для Claude Code, который сам разберётся:

В Claude Code вставь запрос: подключи ко мне GLM-5.3-Flash через OpenRouter
как дополнительного провайдера в claude-code-router. Мой ключ OpenRouter
в .env как OPENROUTER_API_KEY. Модель на OpenRouter называется
z-ai/glm-5.3-flash. Настрой роутинг: длинные задачи (>50k токенов контекста)
и агентные пайплайны идут в GLM-5.3-Flash, короткие ответы и уточнения -
в Claude Sonnet. Покажи мне итоговый конфиг.

Это честнее, чем вручную ковырять конфиги. Плюс роутер будет выбирать провайдера по типу задачи, а не переключать модель руками.

Как поставить локально или на своём сервере

Веса на HuggingFace: zai-org/GLM-5.3-Flash (стандартный формат) и zai-org/GLM-5.3-Flash-BF16 (для BF16-инференса). 320B параметров - это ~640 ГБ VRAM в FP16 без квантизации. Для домашнего железа нереально, для одиночной H100 - тоже нет.

Реалистичный вариант локального инференса - квантизация до 4-битной GGUF (через llama.cpp) или запуск на кластере из 8x A100 через vLLM.

Запуск с vLLM (нужен кластер или облако):

pip install -U "huggingface_hub[cli]" vllm
huggingface-cli download zai-org/GLM-5.3-Flash --local-dir ./glm-5.3-flash
vllm serve ./glm-5.3-flash --tensor-parallel-size 8 --max-model-len 1048576

На выходе - OpenAI-совместимый эндпоинт на localhost:8000/v1. Дальше подключаете любой OpenRouter-клиент, только меняете base_url на свой сервер.

Для большинства проектов держать локально невыгодно - через OpenRouter получается дешевле, чем платить за GPU-хостинг.

Стоит ли переносить прод с Claude или GPT

Мой ответ на 26 августа: для типового кода и рефакторинга - да, для критических агентных пайплайнов - подождать.

Плюсы, за что реально можно переходить:

  • Цена. В 66 раз дешевле Opus 4.8 по инпуту - это не оптимизация, это переопределение экономики.
  • Контекст 1M. Влезает средний репозиторий целиком, не нужно резать чанками.
  • MIT-лицензия. Можно ставить локально, никаких платежей за токены на закрытых контурах.

Минусы, из-за чего не всё сразу:

  • Модель свежая, продовые кейсы ещё не собраны. Первая неделя релиза - не время тащить в критичные пайплайны.
  • Провайдерская инфраструктура Z.ai пока молодая. OpenRouter стабильнее, но добавляет прослойку.
  • На сложных SWE-задачах Opus 4.8 всё ещё чуть точнее. Разрыв небольшой, но в проде решает.

Практика на неделю: возьмите один рабочий пайплайн, где Claude Sonnet справляется, и параллельно прогоните через GLM-5.3-Flash. Сравните руками - скорость, качество, счёт. Через 5-7 прогонов будет видно, куда двигать.

FAQ

Где смотреть, что модель точно от Z.ai, а не подделка? Официальный анонс - в блоге z.ai и на HuggingFace от zai-org. Веса подписаны, есть исходный technical report на arxiv (2508.06471). Если качаете не с zai-org - это уже не оригинал.

Правда, что в 10 раз дешевле GPT и Claude? Бекдор в анонсе занизил: на OpenRouter GLM-5.3-Flash в 66 раз дешевле Claude Opus 4.8 по инпуту и в 100 раз по аутпуту. Против базовой GLM-5.3 разница поменьше (в 5-10 раз), это тоже правда.

Мультимодальность работает или это маркетинг? Вход - реально текст+картинки+видео. Выход - только текст (не генерирует изображения). Для разбора скриншотов, схем, коротких видео - работает. Проверено в chat.z.ai.

Что с приватностью, если гоняю через chat.z.ai? Z.ai - китайская компания, юрисдикция КНР. Персональные данные клиентов, коммерческие тайны и любые чувствительные документы туда лить не стоит. Для открытого кода, пет-проектов и обучающих задач - ок.

Есть ли смысл дожидаться GLM-5.3 (не Flash)? Базовая GLM-5.3 существует с 14 августа, но её нет в открытом доступе как весов. Flash - это уменьшенная и удешевлённая версия, и на публичных бенчах она даёт 90%+ качества от старшей. Ждать полную не обязательно.

Вывод

GLM-5.3-Flash - первый случай, когда открытая модель под MIT реально давит фронтир Anthropic по деньгам, а не по маркетингу. 320B параметров MoE, 1M контекст, мультимодальный вход, доступна четырьмя способами - от бесплатного чата до локального инференса. По кодингу - в 2-5 пунктах от Claude Opus 4.8 на большинстве бенчей, при этом в 66 раз дешевле по инпуту.

Что делать на этой неделе: 1) открыть chat.z.ai и погонять в чате на своих задачах, 2) сгенерить ключ OpenRouter и подключить z-ai/glm-5.3-flash в свой рабочий редактор, 3) параллельно прогнать один рабочий пайплайн через GLM и через Claude - сравнить руками. Через неделю решение по проду примется само.

Напоминаю, что stealth-версия Ox Alpha сама по себе разбиралась в отдельной статье: Ox Alpha на OpenRouter - там подробнее про историю релиза и первые тесты, когда авторство ещё не подтвердили. Про использование GLM в редакторе с телефона тоже есть - zcode: GLM для вайбкодинга.

Что дальше

Если хочешь собрать такую систему у себя - у меня есть курс по вайбкодингу и работе с нейросетями в клубе Мандарин Лаб: mandarinedu.ru. Первые уроки открыты бесплатно.

Если нужно внедрить ИИ в бизнес - процессы, агентов, автоматизацию под вашу задачу - пишите мне напрямую: t.me/Philigranchik. Разберу задачу и скажу, что реально автоматизируется, а что нет.

Бесплатный первый урок

Хочешь собрать это сам - с нуля до первого клиента?

В первом уроке показываю весь путь по шагам: ставим Claude Code, собираем первый рабочий инструмент и как на этом начать зарабатывать. Без воды и без кода.

Смотреть первый урок →
Михаил Иванин
Об авторе

Вайбкодер-разработчик и маркетолог с 9-летним опытом, основатель «Мандарин Лаб». Собирает на ИИ то, за что раньше платили подрядчикам сотни тысяч: CRM, ботов, автоматизации, монтаж. Одну из систем строил под агентство недвижимости с базой в 400 000 лидов. Теперь учит этому с нуля - как за вечер собрать свой инструмент через Claude Code и зарабатывать на нейросетях.

Telegram @mike_cmo →Кто такой Михаил Иванин →
#glm-5.3-flash#z.ai#ox alpha#openrouter#открытые модели#claude opus 4.8#1M контекст