DeepSeek V4 Pro: обзор релиза 0813 и настройка Codex

DeepSeek V4 Pro: обзор релиза 0813 и настройка Codex
DeepSeek V4 Pro вышла из четырёхмесячного превью 12-13 августа 2026 сборкой 0813. Это MoE-модель на 1.6 трлн параметров (49 млрд активных), контекст 1 млн токенов, три уровня рассуждений и заявленные 80.6% на SWE-bench Verified. Цена входа - $0.435 за миллион токенов, выхода - $0.87, кэш-хит - $0.003625. Подключается к Codex, ChatGPT CLI и VS Code через один официальный скрипт. Ниже разбираю, что реально изменилось, когда какой режим брать и стоит ли переезжать с Claude или GPT.
Что нового в сборке 0813
Версия 0813 - это первый GA-релиз V4 Pro после апрельского превью. Основное:
- MoE 1.6T параметров, 49B активных - при генерации ответа работает только часть экспертов, поэтому цена держится низкой.
- Контекст 1 млн токенов, ответ до 384 тыс. - реально хватает на большой репозиторий целиком.
- Две новые архитектуры внимания - HCA и CSA - по данным DeepSeek, инференс жрёт 27% от V3.2, а KV-кэш - 10% при максимальном контексте.
- Нативная поддержка OpenAI ChatCompletions, Anthropic Messages и DeepSeek Responses API - переезжаете сменой base_url, без переписывания клиента.
- Официальный setup-скрипт под Codex - подцепляет модель в ChatGPT CLI, десктопное приложение и расширение VS Code.
- Три режима рассуждений -
low,high(по умолчанию) иmaxчерез параметрreasoning_effort.
Веса V3-семейства лежат на Hugging Face открыто (за прошлый месяц - 1.4 млн скачиваний), но production-веса 0813 на момент публикации ещё не выложены. Модель пока доступна только через API и на chat.deepseek.com.
Три уровня рассуждений: когда какой брать
В V4 Pro DeepSeek развела режимы явно. Раньше был бинарь "думает / не думает", теперь три ступени плюс выключенный:
- non-thinking - ответ сразу, без цепочки рассуждений. Для чатов, коротких вопросов, генерации текста.
- low - минимальная глубина. Простые задачи, где логика есть, но короткая (переписать SQL, объяснить регулярку).
- high - дефолт. Кодинг средней сложности, разбор багов, рефакторинг файла.
- max - максимальная глубина. Сложный алгоритм, поиск причины в чужом легаси, дизайн архитектуры.
Переключение через API:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="max",
extra_body={"thinking": {"type": "enabled"}},
messages=[{"role": "user", "content": "..."}]
)
Отдельно приходит поле reasoning_content - цепочка рассуждений, отделённая от финального content. Важный момент: при работе с tool calls это поле обязательно передавать обратно в следующем запросе, иначе модель ломается.
Практика: max жрёт больше output-токенов и заметно медленнее, поэтому для рутины ставьте high или ниже. max брать только когда high уже не тянет.
Бенчмарки: где V4 Pro упирается в потолок
Цифры из официального анонса и вендорских тестов:
| Бенчмарк | V4 Pro 0813 |
|---|---|
| SWE-bench Verified | 80.6% |
| LiveCodeBench pass@1 | 93.5% |
| GPQA Diamond pass@1 | 90.1% |
| MMLU-Pro | 87.5% |
| Codeforces rating | 3206 |
Перевод на человеческий: по кодингу тянет уровень топовых закрытых моделей 2026 года. SWE-bench Verified 80.6% - это когда модель самостоятельно закрывает реальные issue из открытых репозиториев на GitHub. Год назад лучшие модели брали 60-65%, полгода назад - 70-75%.
Осторожность: бенчмарки вендорские, независимые прогоны появятся в ближайшие недели. Пока это заявленный уровень, не подтверждённый третьей стороной.
Цены: сколько стоит миллион токенов
Тарифы API DeepSeek на V4 Pro:
- Вход, кэш-мисс - $0.435 за миллион токенов.
- Вход, кэш-хит - $0.003625 за миллион (в 120 раз дешевле, если повторяете системный промпт).
- Выход - $0.87 за миллион.
- Лимит одновременных запросов - 500 для Pro-модели, 2500 для Flash.
Для сравнения: Claude Opus 4.6 - $15 за миллион входа и $75 за выход. GPT-5 (топовая) - в том же порядке. V4 Pro получается в 30-100 раз дешевле по кодинговым задачам при близком качестве.
DeepSeek предупредила о будущем повышении цен, но точную дату и новые ставки не назвала. Есть смысл прогонять большие пайплайны сейчас.
Как подключить V4 Pro к Codex
Для тех, кто уже сидит в ChatGPT CLI, Codex CLI или расширении VS Code - DeepSeek выложила официальный one-click скрипт. Не нужно ковыряться в конфигах.
Что нужно:
- Свежий Codex CLI (обновите до последней версии).
- Пополненный аккаунт DeepSeek API с API-ключом.
- Запустить установочный скрипт из официальной документации DeepSeek.
После установки в стартовом баннере Codex должно висеть model: deepseek-v4-pro. Скрипт запоминает конфиг и позволяет переключаться между V4 Pro и V4 Flash из меню, а также откатить всё к состоянию до установки. Тот же скрипт освежает список моделей, если DeepSeek выкатит новую версию.
Если Codex у вас не установлен, а хочется поработать с V4 Pro в терминале - вот готовый запрос для Claude Code, чтобы он развернул рабочую связку с нуля:
Собери мне минимальный CLI-агент, который стучится в DeepSeek V4 Pro
через OpenAI-совместимый эндпоинт. Возьми endpoint api.deepseek.com/v1,
модель deepseek-v4-pro, ключ из переменной DEEPSEEK_API_KEY.
Сделай простой чат-режим: prompt из stdin, ответ в stdout, история
в памяти процесса. Добавь флаг --effort со значениями low/high/max,
чтобы прокидывать reasoning_effort в запрос. Верни один файл chat.py
и requirements.txt.
Совместимость: три API в одной модели
V4 Pro поддерживает три формата запросов одновременно:
- OpenAI ChatCompletions - меняете
base_urlнаhttps://api.deepseek.com/v1иapi_keyв вашем OpenAI SDK. Больше ничего. - Anthropic Messages - тот же трюк для клиентов, написанных под Claude SDK.
- DeepSeek Responses API - собственный формат DeepSeek под агентные сценарии, ближе к OpenAI Responses.
Это главная практическая штука релиза. Если у вас пайплайн на OpenAI SDK или Anthropic SDK - переезд стоит два изменения в конфиге. Не надо переписывать retry-логику, tool-схемы, стриминг.
Про Claude Code: официальной интеграции DeepSeek с Claude Code нет. Но Claude Code работает через API, поэтому через прокси-обёртки типа LiteLLM или Claude Code Router можно направить его на DeepSeek. Это уже сообщество, не официальная поддержка.
Стоит ли переезжать с Claude или GPT
Честно: полностью съезжать - не всегда. По моему опыту работы с китайскими моделями:
Куда V4 Pro подходит хорошо:
- Массовый кодинг: переписать сервис, сгенерить кучу тестов, разобрать большой файл. Соотношение цена/качество бьёт всех.
- Обработка длинных документов - 1M контекст даёт впихнуть репозиторий или большой PDF целиком.
- Агентные пайплайны, где важна цена за миллион вызовов.
Куда я бы пока оставил Claude или GPT:
- Тонкий русскоязычный копирайтинг с голосом бренда - Claude Sonnet тут пока чище.
- Работа с чувствительными данными клиентов - серверы DeepSeek в Китае, юридические последствия по 152-ФЗ надо считать отдельно.
- Задачи, где важна нативная интеграция с Anthropic-экосистемой (Claude Skills, Claude Connectors, Claude Projects) - там DeepSeek не встанет.
Практичный маршрут: держать Claude или GPT как основной инструмент, а V4 Pro подключить вторым API для массовой генерации кода и обработки длинных контекстов, где ценник Anthropic начинает кусаться.
Ограничения и подводные камни
- Веса 0813 пока не в открытом доступе. Только API и chat.deepseek.com. Локально пока запускается V3-семейство.
- Юрисдикция. DeepSeek - китайский сервис. Для персональных данных пользователей из РФ по 152-ФЗ нужен либо явный согласие, либо российское размещение (которого нет).
- Бенчмарки вендорские. Независимые прогоны SWE-bench и LiveCodeBench появятся в ближайшие недели. Пока верим на слово.
- Кэш-хит не автомат. Скидка $0.003625 за миллион работает, только если совпадает префикс запроса. Для рутинных пайплайнов с одинаковым системным промптом - огромная экономия, для разовых чатов - не сработает.
- Три режима не панацея.
maxне всегда лучше, чемhigh. Для простых задачmaxдаёт длинную ненужную цепочку размышлений и увеличивает счёт.
FAQ
Чем V4 Pro отличается от V4 Flash? Pro - топовая модель, ставка на качество и сложные задачи. Flash - лёгкая версия для массовой рутины: дешевле, быстрее, лимит одновременных запросов выше (2500 против 500). Для агентов, которые дёргают модель тысячи раз в день, Flash обычно лучше.
Можно ли скачать веса V4 Pro и запустить локально? Production-веса сборки 0813 на момент публикации не выложены. V3.2 лежит на Hugging Face, но это предыдущее поколение. Если нужна локальная модель уровня 2026 - смотрите Kimi K3 или Qwen через Ollama.
Работает ли V4 Pro с Claude Code? Официально нет. Неофициально - через прокси (LiteLLM, Claude Code Router) можно направить трафик Claude Code на DeepSeek. Работает, но без гарантий совместимости с обновлениями Claude Code. Для основного инструмента используйте Claude Code напрямую.
Как переключать режимы рассуждения через API?
Через параметр reasoning_effort со значениями low, high, max. По умолчанию high. Плюс отдельный флаг {"thinking": {"type": "enabled"}} в extra_body. Ответ приходит с полем reasoning_content рядом с обычным content.
Есть ли ограничения при доступе из России? chat.deepseek.com и api.deepseek.com пока открыты для российских IP без VPN. Оплата по международным картам, работает через посредников или зарубежные счета.
Вывод
V4 Pro - не революция, а закономерное развитие: DeepSeek продолжает давить ценой при качестве, близком к топовым закрытым моделям. Три уровня рассуждений, миллионный контекст и совместимость с OpenAI/Anthropic SDK - это скорее удобство разработчика, чем прорыв. Codex-интеграция за один скрипт - хороший ход, если вы уже сидите в этой экосистеме.
Если гоняете много кода через API и цены Claude или GPT начинают жать - имеет смысл подключить V4 Pro вторым источником и распределять задачи. Полностью переезжать не советую, пока не появятся независимые бенчмарки и пока веса 0813 не лягут в открытый доступ.
Что дальше
Если хочешь собрать такую систему у себя - у меня есть курс по вайбкодингу и работе с нейросетями в клубе Мандарин Лаб: mandarinedu.ru. Первые уроки открыты бесплатно.
Если нужно внедрить ИИ в бизнес - процессы, агентов, автоматизацию под вашу задачу - пишите мне напрямую: t.me/Philigranchik. Разберу задачу и скажу, что реально автоматизируется, а что нет.

Вайбкодер-разработчик и маркетолог с 9-летним опытом, основатель «Мандарин Лаб». Собирает на ИИ то, за что раньше платили подрядчикам сотни тысяч: CRM, ботов, автоматизации, монтаж. Одну из систем строил под агентство недвижимости с базой в 400 000 лидов. Теперь учит этому с нуля - как за вечер собрать свой инструмент через Claude Code и зарабатывать на нейросетях.
Telegram @mike_cmo →Кто такой Михаил Иванин →