🛠 AI-инструменты

FreeToken: запуск больших MoE-моделей локально

Михаил ИванинМихаил Иванин22 августа 2026 г.6 мин чтения
FreeToken: запуск больших MoE-моделей локально
✈️
Свежие гайды и обзоры выходят в моём Telegram первыми
Подписаться →

FreeToken: запуск больших MoE-моделей локально

FreeToken - это движок для локального запуска гигантских MoE-моделей (Mixture of Experts) на потребительском железе: от ноутбука с RTX 4060 8 ГБ до одной workstation-видеокарты. Проект собрала команда из Berkeley и MIT (Song Han, Matei Zaharia, Ion Stoica и другие), опубликовала статью 17 августа 2026 и выложила код под Apache 2.0. К моменту публикации у репозитория FlashML-org/FreeToken уже больше 1500 звёзд.

Что такое FreeToken простыми словами

Обычные локальные движки типа llama.cpp или vLLM упираются в память видеокарты: не влезли веса - модель не запускается. FreeToken решает задачу иначе. Он видит домашний ПК как связку ресурсов - GPU, CPU, оперативка, шины - и раскидывает вычисления по ним динамически. То, что не поместилось в VRAM, крутится на CPU и подгружается по мере необходимости.

Работает конкретно с разреженными MoE-моделями, где на каждый токен активна только часть параметров. Именно это даёт эффект: 284-миллиардная модель влезает на игровой десктоп, потому что физически считается только маленькая её часть за раз.

Какие модели реально запускаются

По официальному README поддерживаются:

  • DeepSeek-V4-Flash (около 284B параметров) - на игровом десктопе с одной RTX 5090
  • Qwen3.6-35B-A3B - на ноутбуке с 8 ГБ VRAM (RTX 4060 или аналог)
  • GLM-5.2 (753B) - на одиночной workstation-видеокарте
  • всего заявлено более 20 open-weight MoE-моделей

Поддерживаемые квантования: MXFP4, NVFP4, FP8, BF16. Железо: NVIDIA RTX 30/40/50-серии. Windows и Linux.

Конкретные цифры пропускной способности (токены в секунду) команда приводит в статье и в бенчмарках репозитория - проверять под своё железо, потому что скорость зависит от модели, квантования, длины контекста и текущей загрузки памяти.

Как это работает под капотом

Технически ключевых трюков три:

  1. Bandwidth-adaptive execution - движок непрерывно замеряет, где узкое место (шина PCIe, скорость CPU, DRAM, VRAM) и перераспределяет слои.
  2. Semantic-aware caching - для агентских сценариев (правки в истории, tool call, thinking-блоки) не пересчитывает весь контекст, а поднимает частичный слепок.
  3. Elastic memory management - на лету переразмечает VRAM между кэшами экспертов и KV-кэшем без перезапуска движка и без перезагрузки весов.

По сути FreeToken делает то, что раньше умели только серверные фермы: держит модель "размазанной" по железу и жонглирует ресурсами прямо во время генерации.

Установка FreeToken: одна команда

Есть два пути. Через десктоп-приложение (Windows/Linux) с сайта flashml.ai - GUI, инсталлер сам ставит движок и даёт визуальную консоль. Или через CLI:

uv pip install "freetoken[accel]"

Если нужен исходный код:

git clone https://github.com/FlashML-org/FreeToken.git && cd FreeToken
uv venv && source .venv/bin/activate
uv pip install -e ".[accel]"

Дальше - раздел docs/quickstart.md в репозитории и список моделей в docs/models.md.

Как подключить FreeToken к Claude Code

Фишка, из-за которой стоит вообще ставить: FreeToken отдаёт API, совместимый с Anthropic и OpenAI. Любой агент, который умеет ходить в Claude или GPT, можно натравить на локальную модель без переписывания кода. В список подтверждённых интеграций входят Claude Code, Codex, OpenCode, DeepSeek Harness.

Практический шаг - переключить Claude Code на локальный эндпоинт. В самом Claude Code вставь такой запрос:

Настрой Claude Code на локальный эндпоинт FreeToken.
Задача: поменять ANTHROPIC_BASE_URL на адрес, который выдаёт `freetoken serve`,
проверить, что модель отвечает через `claude /doctor`,
и вывести имя модели, которую FreeToken сейчас держит загруженной.
Если что-то не так - покажи логи FreeToken и предложи фикс.

После этого правки в проекте пойдут через локальную модель. Отвалится интернет - агент продолжит работать. Кончатся токены на облачной подписке - тоже.

Зачем это в реальной работе

  • Приватность. Код, документы, персональные данные не уходят в облако. Актуально для юрлиц, где NDA запрещает гонять данные через сторонний API.
  • Стоимость. После покупки железа ты не платишь по токенам. Для тех, кто гоняет агента круглосуточно, разница с подпиской окупает видеокарту за месяцы.
  • Автономность. Работает без интернета - в поезде, самолёте, на даче, в командировке.
  • Эксперименты. Можно ковырять веса, файнтюнить, писать свои роутинги без ограничений API.

Подводные камни

  • Модель уровня DeepSeek-V4-Flash 284B требует минимум RTX 5090 и 128+ ГБ ОЗУ. Ноутбук потянет только 35B-класс.
  • Первый запуск - тяжёлый: веса весят сотни гигабайт, качаются часами.
  • Скорость всё равно ниже облачного inference. Если Claude отдаёт 60-80 t/s, локальный запуск в лучшем случае 20-40 t/s на топовом железе. Для чата ок, для потоковой генерации огромного кода - медленнее.
  • Русскоязычной поддержки MoE-моделей меньше: Qwen и DeepSeek с русским работают, GLM хуже. Тестировать под свой домен обязательно.
  • Проект молодой (первый коммит - июль 2026), багов и открытых issue хватает.

FAQ

Нужен ли Docker? Нет, FreeToken ставится напрямую через pip или uv. Работает как обычный Python-пакет с CUDA-акселерацией.

Работает ли на Mac? На момент публикации официально заявлены только Windows и Linux с NVIDIA RTX. Apple Silicon в списке нет.

Насколько это медленнее облака? Зависит от модели и железа. Ожидай в 1.5-3 раза медленнее Claude/GPT по токенам в секунду - в обмен на нулевую цену за запрос и полную приватность.

Можно ли держать несколько моделей одновременно? Движок делает динамическое перераспределение VRAM без перезапуска - переключаться между моделями быстро. Одновременно держать две большие в памяти всё равно не выйдет.

Насколько это стабильно для продакшена? Пока рано. Для личного агента, локальных экспериментов и приватной работы с кодом уже норм. Для клиентского продакшена дождаться первого стабильного релиза и стянуть issue-трекер.

Вывод

FreeToken закрывает главную дыру локального AI: раньше "запустить большую модель дома" значило либо тонуть в очередях облака, либо гонять 7B-огрызок. Теперь на игровом ПК поднимается модель, которая ещё год назад крутилась только в датацентре. Ставится одной командой, подключается к Claude Code за минуту, работает без интернета и без счёта за токены.

Что дальше

Если хочешь собрать такую систему у себя - у меня есть курс по вайбкодингу и работе с нейросетями в клубе Мандарин Лаб: mandarinedu.ru. Первые уроки открыты бесплатно.

Если нужно внедрить ИИ в бизнес - процессы, агентов, автоматизацию под вашу задачу - пишите мне напрямую: t.me/Philigranchik. Разберу задачу и скажу, что реально автоматизируется, а что нет.

Бесплатный первый урок

Хочешь собрать это сам - с нуля до первого клиента?

В первом уроке показываю весь путь по шагам: ставим Claude Code, собираем первый рабочий инструмент и как на этом начать зарабатывать. Без воды и без кода.

Смотреть первый урок →
Михаил Иванин
Об авторе

Вайбкодер-разработчик и маркетолог с 9-летним опытом, основатель «Мандарин Лаб». Собирает на ИИ то, за что раньше платили подрядчикам сотни тысяч: CRM, ботов, автоматизации, монтаж. Одну из систем строил под агентство недвижимости с базой в 400 000 лидов. Теперь учит этому с нуля - как за вечер собрать свой инструмент через Claude Code и зарабатывать на нейросетях.

Telegram @mike_cmo →Кто такой Михаил Иванин →
#freetoken#moe#локальные модели#claude code#deepseek#qwen