🛠 AI-инструменты

NVIDIA Nemotron VoiceChat: голосовой ИИ-агент с вызовом инструментов

Михаил ИванинМихаил Иванин7 августа 2026 г.9 мин чтения
NVIDIA Nemotron VoiceChat: голосовой ИИ-агент с вызовом инструментов
✈️
Свежие гайды и обзоры выходят в моём Telegram первыми
Подписаться →

NVIDIA Nemotron VoiceChat: голосовой ИИ-агент с вызовом инструментов

NVIDIA выложила 3 августа 2026 Nemotron VoiceChat - первую открытую голосовую модель, которая слушает и говорит одновременно и умеет вызывать инструменты посреди разговора. 11 миллиардов параметров, задержка на прерывание 480 мс, обучение на 550 тысячах часов речи. Веса лежат на Hugging Face, лицензия OpenMDW-1.1, код - в отдельной ветке репозитория NVIDIA-NeMo/Speech. Дальше разберу, что это такое, чем отличается от привычной связки Whisper + GPT + TTS, где потрогать без своего GPU и что реально можно поднять дома.

Что такое Nemotron VoiceChat одним экраном

Это end-to-end голосовая модель. То есть звук на входе, звук на выходе, между ними одна нейросеть, а не три склеенных сервиса. Внутри - гибридная архитектура Mamba + Transformer: NVIDIA взяла свою языковую модель Nemotron Nano v2 9B, приклеила спереди речевой энкодер Fast Conformer, сзади - собственный TTS-декодер, и добавила отдельный выходной канал для тул-коллов, который работает параллельно с речью.

Что это даёт на практике:

  • Full-duplex - модель слушает и говорит одновременно, а не по очереди. Можно перебивать.
  • Задержка на прерывание 480 мс, на плавную передачу очереди - 450 мс. Это уровень живого разговора.
  • Умеет эмоции и просодию - не как робот-автоответчик.
  • Английский язык (пока только он).
  • Обучена на 550 000 часов аудио - реальные записи плюс синтетика.

Независимая проверка от Artificial Analysis: единственная открытая голосовая модель, которая одновременно попадает в топ-3 по естественности диалога и по речевому reasoning-у.

Чем это отличается от связки ASR + LLM + TTS

Стандартная сборка голосового бота выглядит так: Whisper распознаёт речь в текст, GPT/Claude обрабатывает текст, ElevenLabs озвучивает ответ. Три модели, три API, три задержки. Пока Whisper дожёвывает фразу, GPT ждёт, потом ждёт ElevenLabs. Итог - секунда-полторы паузы после каждой реплики. Разговор рвётся, перебивать почти невозможно.

VoiceChat делает всё это одной моделью. Речь на входе не превращается в текст-посредник - модель работает напрямую с речевыми токенами и параллельно генерирует ответный звук. Отсюда и 480 мс на прерывание: не нужно ждать, пока Whisper закончит распознавание.

Обратная сторона - модель одна большая (11B параметров, ~22 ГБ в BF16), её нельзя разнести по разным сервисам, нельзя дёшево поменять голос или язык. Whisper + GPT + TTS гибче, VoiceChat - быстрее и живее.

Что за "вызов инструментов посреди разговора"

Основная фишка релиза. Обычные голосовые модели умеют либо говорить, либо думать. VoiceChat - первая открытая, которая умеет вызывать внешние инструменты (поиск, календарь, погоду, любые ваши функции) не останавливая диалог.

Механика такая: пока пользователь говорит "а глянь погоду в Москве на завтра", модель уже начинает генерировать текст тул-колла в отдельный канал. Для каждого инструмента можно задать "on-hold" фразу - что-то вроде "секунду, проверяю" - которая произносится вслух, пока внешний API отрабатывает. Пользователь не слышит мёртвой паузы.

Это именно то, чего не хватало открытым голосовым моделям. Закрытые (OpenAI Realtime API, Google Gemini Live) это умеют, но за деньги и по чужим правилам. VoiceChat закрывает дыру в опенсорсе.

Требования: почему на MacBook и RTX не взлетит

Тут главное разочарование. Модель "открытая", но железо нужно серверное. В карточке официально поддерживаются:

  • NVIDIA A100
  • NVIDIA H100 / H200
  • NVIDIA B100 / B200
  • NVIDIA RTX-6000 (профессиональная, не RTX 4090)

RTX 4090, RTX 5090, MacBook M-серии, любые consumer-GPU в списке отсутствуют. Причина - full-duplex-инференс требует держать в памяти и языковую модель, и энкодер, и декодер одновременно, плюс real-time-стриминг. По оценке требований к Blueprint от самой NVIDIA - минимум один GPU с 72 ГБ памяти или два по 40 ГБ.

Что это значит для читателя без датацентра:

  1. Скачать веса и запустить у себя дома - не выйдет, если у тебя не A100/H100.
  2. Арендовать H100 в облаке - выйдет, но дорого (порядок $2-3 в час).
  3. Пощупать через NVIDIA Build без своего GPU - работает и бесплатно, если нужен просто попробовать.

Либо ждать квантизованных версий от энтузиастов - обычно они появляются в течение месяца после релиза, но качество full-duplex-стриминга при квантизации падает сильнее, чем у обычных LLM.

Как потрогать бесплатно через NVIDIA Build

Самый быстрый путь для тех, кто хочет просто послушать. NVIDIA хостит модели на своём портале build.nvidia.com и раздаёт бесплатный доступ - 40 запросов в минуту без карты, только по email. Подробнее про этот ключ разбирал в бесплатном API от NVIDIA.

Шаги без воды:

  1. Зарегистрироваться на build.nvidia.com по email.
  2. Найти в каталоге "Nemotron Voice Agent" или прямую ссылку.
  3. Забрать API-ключ в личном кабинете.
  4. Использовать OpenAI-совместимый эндпоинт https://integrate.api.nvidia.com/v1.

Если лень руками - открой Claude Code в папке проекта и попроси собрать минимальный клиент:

Собери минимальный Python-скрипт, который:
1) читает мой микрофон 5 секунд,
2) отправляет аудио в NVIDIA Build voice-agent endpoint
   (ключ бери из переменной NVIDIA_API_KEY, base_url https://integrate.api.nvidia.com/v1),
3) проигрывает ответный звук.
Без веб-интерфейса, просто CLI. Зависимости минимальные - pyaudio + openai SDK.
Покажи установку и запуск.

Claude Code сам поставит зависимости, поднимет скрипт и объяснит, где что подкрутить. Дальше уже добавляешь свои инструменты - календарь, поиск, что угодно.

Как поднять локально или на облачной H100

Если у тебя есть A100/H100 или ты готов арендовать в облаке (Runpod, Vast.ai, Lambda), поднимается так. Официальная последовательность из репозитория:

# 1. Клонировать нужную ветку
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"

# 2. Создать окружение
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"

# 3. Скачать веса модели с Hugging Face
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B \
  --local-dir ./checkpoints/voicechat

# 4. Пробный прогон на тестовом файле
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" \
  --checkpoint ./checkpoints/voicechat \
  --wav examples/speechlm2/sample_audio/sample_general.wav \
  --output-dir ./out

Это оффлайн-инференс на готовом wav-файле - минимальная проверка, что всё работает. Полноценный real-time-loop с микрофоном и tool-use собирается сверху отдельно.

Если не хочешь возиться с зависимостями руками - открой репозиторий в Claude Code и попроси:

Я на арендованном H100 в облаке. Установи Nemotron VoiceChat 11B из ветки
nemotron-labs-voicechat репозитория NVIDIA-NeMo/Speech по инструкции из README.
Скачай веса модели, прогони offline_voicechat_infer.py на sample_general.wav,
покажи мне готовый wav-файл ответа. Все ошибки установки чини сам.

Готовый Blueprint от NVIDIA - что внутри

Отдельная штука для тех, кому нужен не голый чекпоинт, а готовый продакшн-каркас. NVIDIA выложила репозиторий NVIDIA-AI-Blueprints/nemotron-voice-agent - reference-имплементация целого голосового агента под docker compose. Лицензия BSD-2-Clause.

Внутри собрана вся связка:

  • ASR: Nemotron ASR Streaming или Parakeet multilingual
  • LLM: Nemotron 3 Nano 30B или Super 120B
  • TTS: Magpie TTS Multilingual
  • Оркестратор с обработкой прерываний
  • Веб-интерфейс на порту 7860

Запуск для workstation с локальным GPU:

git clone https://github.com/NVIDIA-AI-Blueprints/nemotron-voice-agent.git
cd nemotron-voice-agent
cp .env.example .env
export NVIDIA_API_KEY=<твой-ключ>
printf '%s' "$NVIDIA_API_KEY" | docker login nvcr.io -u '$oauthtoken' --password-stdin
docker compose --profile generic-assistant/workstation up -d

Потом открыть https://<ip-машины>:7860 и общаться. Есть и cloud-профиль, где вся тяжёлая математика уходит на NVIDIA-хосты, а у тебя крутится только оркестратор - тогда GPU не нужен.

Блюпринт удобнее, чем голая модель: тут уже прописано, как чинить прерывания, как отдавать tool-response обратно в диалог, как логировать. Хорошая точка старта, если строишь свой продукт.

Ограничения, о которых не пишет пресс

Чего в громких постах про "личный Джарвис" обычно не пишут:

  1. Только английский. Русский, китайский, испанский - пока нет. Для русскоязычного продукта прямо сейчас модель бесполезна как самостоятельный агент - только для служебных сценариев с англоязычными юзерами.
  2. "Research purposes only" в карточке модели. Формально коммерческое использование не запрещено (лицензия OpenMDW-1.1 разрешает), но пометка есть - юристам стоит перечитать текст лицензии до продакшена.
  3. Дорого в проде. H100 в облаке - $2-3/час. Если у тебя 100 одновременных сессий, нужен серьёзный бюджет на инференс. Cloud-blueprint от NVIDIA перекладывает эту стоимость на их сторону, но там свои лимиты.
  4. Голоса не переключаются на лету. Модель обучена на конкретных голосах, кастомный voice cloning как в ElevenLabs - не завезли.
  5. Английский-только TTS. Даже если прикрутишь перевод LLM в русский, озвучит она это по-английски.

Это не значит "плохо". Это значит - Nemotron VoiceChat про инженерный прорыв в архитектуре, а не про готовое решение под ключ. Прорыв реальный: первый открытый full-duplex с tool-use - это то, чего рынок ждал год.

FAQ

Поддерживает ли Nemotron VoiceChat русский язык?

Нет. Официально заявлен только английский. В карточке модели язык прямо прописан в названии - Nemotron-Speech-Streaming-En-0.6b. Мультиязычная версия не анонсирована.

Можно ли использовать в коммерческом продукте?

Лицензия OpenMDW-1.1 сама по себе разрешает коммерческое использование, но карточка модели помечена "ready for research purposes only". Это противоречие - юристам стоит прочитать текст лицензии до релиза. Blueprint (BSD-2-Clause) чище с юридической стороны, но там всё равно используется та же самая модель.

Сколько будет стоить облачный запуск на H100?

Порядок цен по состоянию на август 2026: Runpod H100 SXM - около $2-3 в час, Lambda Cloud - примерно столько же, Vast.ai может быть дешевле но менее стабильно. Одна модель на 11B в BF16 займёт около 22 ГБ памяти - помещается на H100 80GB с большим запасом под контекст и стриминг.

Есть ли что-то похожее открытое кроме Nemotron?

Частично. Moshi от Kyutai - тоже full-duplex, но без нормального tool-use и меньше по параметрам. Другие открытые голосовые модели (Ultravox, Qwen-Audio, Whisper-family) либо не full-duplex, либо только распознают речь, либо только генерируют. VoiceChat пока единственный, кто закрыл всю тройку сразу.

Заменит ли это ElevenLabs?

Нет. ElevenLabs - про кастомные голоса, клонирование, богатую библиотеку языков и голосов, готовое API. Nemotron VoiceChat - про архитектуру голосового агента с тул-коллами. Это разные продукты. Про ElevenLabs в связке с Claude Code писал отдельно.

Что дальше

Если хочешь собрать такую систему у себя - у меня есть курс по вайбкодингу и работе с нейросетями в клубе Мандарин Лаб: mandarinedu.ru. Первые уроки открыты бесплатно.

Если нужно внедрить ИИ в бизнес - процессы, агентов, автоматизацию под вашу задачу - пишите мне напрямую: t.me/Philigranchik. Разберу задачу и скажу, что реально автоматизируется, а что нет.

Бесплатный первый урок

Хочешь собрать это сам - с нуля до первого клиента?

В первом уроке показываю весь путь по шагам: ставим Claude Code, собираем первый рабочий инструмент и как на этом начать зарабатывать. Без воды и без кода.

Смотреть первый урок →
Михаил Иванин
Об авторе

Вайбкодер-разработчик и маркетолог с 9-летним опытом, основатель «Мандарин Лаб». Собирает на ИИ то, за что раньше платили подрядчикам сотни тысяч: CRM, ботов, автоматизации, монтаж. Одну из систем строил под агентство недвижимости с базой в 400 000 лидов. Теперь учит этому с нуля - как за вечер собрать свой инструмент через Claude Code и зарабатывать на нейросетях.

Telegram @mike_cmo →Кто такой Михаил Иванин →
#nvidia#nemotron#voice ai#голосовой агент#открытая модель#tool calling