FreeToken: запуск больших MoE-моделей локально

FreeToken: запуск больших MoE-моделей локально
FreeToken - это движок для локального запуска гигантских MoE-моделей (Mixture of Experts) на потребительском железе: от ноутбука с RTX 4060 8 ГБ до одной workstation-видеокарты. Проект собрала команда из Berkeley и MIT (Song Han, Matei Zaharia, Ion Stoica и другие), опубликовала статью 17 августа 2026 и выложила код под Apache 2.0. К моменту публикации у репозитория FlashML-org/FreeToken уже больше 1500 звёзд.
Что такое FreeToken простыми словами
Обычные локальные движки типа llama.cpp или vLLM упираются в память видеокарты: не влезли веса - модель не запускается. FreeToken решает задачу иначе. Он видит домашний ПК как связку ресурсов - GPU, CPU, оперативка, шины - и раскидывает вычисления по ним динамически. То, что не поместилось в VRAM, крутится на CPU и подгружается по мере необходимости.
Работает конкретно с разреженными MoE-моделями, где на каждый токен активна только часть параметров. Именно это даёт эффект: 284-миллиардная модель влезает на игровой десктоп, потому что физически считается только маленькая её часть за раз.
Какие модели реально запускаются
По официальному README поддерживаются:
- DeepSeek-V4-Flash (около 284B параметров) - на игровом десктопе с одной RTX 5090
- Qwen3.6-35B-A3B - на ноутбуке с 8 ГБ VRAM (RTX 4060 или аналог)
- GLM-5.2 (753B) - на одиночной workstation-видеокарте
- всего заявлено более 20 open-weight MoE-моделей
Поддерживаемые квантования: MXFP4, NVFP4, FP8, BF16. Железо: NVIDIA RTX 30/40/50-серии. Windows и Linux.
Конкретные цифры пропускной способности (токены в секунду) команда приводит в статье и в бенчмарках репозитория - проверять под своё железо, потому что скорость зависит от модели, квантования, длины контекста и текущей загрузки памяти.
Как это работает под капотом
Технически ключевых трюков три:
- Bandwidth-adaptive execution - движок непрерывно замеряет, где узкое место (шина PCIe, скорость CPU, DRAM, VRAM) и перераспределяет слои.
- Semantic-aware caching - для агентских сценариев (правки в истории, tool call, thinking-блоки) не пересчитывает весь контекст, а поднимает частичный слепок.
- Elastic memory management - на лету переразмечает VRAM между кэшами экспертов и KV-кэшем без перезапуска движка и без перезагрузки весов.
По сути FreeToken делает то, что раньше умели только серверные фермы: держит модель "размазанной" по железу и жонглирует ресурсами прямо во время генерации.
Установка FreeToken: одна команда
Есть два пути. Через десктоп-приложение (Windows/Linux) с сайта flashml.ai - GUI, инсталлер сам ставит движок и даёт визуальную консоль. Или через CLI:
uv pip install "freetoken[accel]"
Если нужен исходный код:
git clone https://github.com/FlashML-org/FreeToken.git && cd FreeToken
uv venv && source .venv/bin/activate
uv pip install -e ".[accel]"
Дальше - раздел docs/quickstart.md в репозитории и список моделей в docs/models.md.
Как подключить FreeToken к Claude Code
Фишка, из-за которой стоит вообще ставить: FreeToken отдаёт API, совместимый с Anthropic и OpenAI. Любой агент, который умеет ходить в Claude или GPT, можно натравить на локальную модель без переписывания кода. В список подтверждённых интеграций входят Claude Code, Codex, OpenCode, DeepSeek Harness.
Практический шаг - переключить Claude Code на локальный эндпоинт. В самом Claude Code вставь такой запрос:
Настрой Claude Code на локальный эндпоинт FreeToken.
Задача: поменять ANTHROPIC_BASE_URL на адрес, который выдаёт `freetoken serve`,
проверить, что модель отвечает через `claude /doctor`,
и вывести имя модели, которую FreeToken сейчас держит загруженной.
Если что-то не так - покажи логи FreeToken и предложи фикс.
После этого правки в проекте пойдут через локальную модель. Отвалится интернет - агент продолжит работать. Кончатся токены на облачной подписке - тоже.
Зачем это в реальной работе
- Приватность. Код, документы, персональные данные не уходят в облако. Актуально для юрлиц, где NDA запрещает гонять данные через сторонний API.
- Стоимость. После покупки железа ты не платишь по токенам. Для тех, кто гоняет агента круглосуточно, разница с подпиской окупает видеокарту за месяцы.
- Автономность. Работает без интернета - в поезде, самолёте, на даче, в командировке.
- Эксперименты. Можно ковырять веса, файнтюнить, писать свои роутинги без ограничений API.
Подводные камни
- Модель уровня DeepSeek-V4-Flash 284B требует минимум RTX 5090 и 128+ ГБ ОЗУ. Ноутбук потянет только 35B-класс.
- Первый запуск - тяжёлый: веса весят сотни гигабайт, качаются часами.
- Скорость всё равно ниже облачного inference. Если Claude отдаёт 60-80 t/s, локальный запуск в лучшем случае 20-40 t/s на топовом железе. Для чата ок, для потоковой генерации огромного кода - медленнее.
- Русскоязычной поддержки MoE-моделей меньше: Qwen и DeepSeek с русским работают, GLM хуже. Тестировать под свой домен обязательно.
- Проект молодой (первый коммит - июль 2026), багов и открытых issue хватает.
FAQ
Нужен ли Docker? Нет, FreeToken ставится напрямую через pip или uv. Работает как обычный Python-пакет с CUDA-акселерацией.
Работает ли на Mac? На момент публикации официально заявлены только Windows и Linux с NVIDIA RTX. Apple Silicon в списке нет.
Насколько это медленнее облака? Зависит от модели и железа. Ожидай в 1.5-3 раза медленнее Claude/GPT по токенам в секунду - в обмен на нулевую цену за запрос и полную приватность.
Можно ли держать несколько моделей одновременно? Движок делает динамическое перераспределение VRAM без перезапуска - переключаться между моделями быстро. Одновременно держать две большие в памяти всё равно не выйдет.
Насколько это стабильно для продакшена? Пока рано. Для личного агента, локальных экспериментов и приватной работы с кодом уже норм. Для клиентского продакшена дождаться первого стабильного релиза и стянуть issue-трекер.
Вывод
FreeToken закрывает главную дыру локального AI: раньше "запустить большую модель дома" значило либо тонуть в очередях облака, либо гонять 7B-огрызок. Теперь на игровом ПК поднимается модель, которая ещё год назад крутилась только в датацентре. Ставится одной командой, подключается к Claude Code за минуту, работает без интернета и без счёта за токены.
Что дальше
Если хочешь собрать такую систему у себя - у меня есть курс по вайбкодингу и работе с нейросетями в клубе Мандарин Лаб: mandarinedu.ru. Первые уроки открыты бесплатно.
Если нужно внедрить ИИ в бизнес - процессы, агентов, автоматизацию под вашу задачу - пишите мне напрямую: t.me/Philigranchik. Разберу задачу и скажу, что реально автоматизируется, а что нет.

Вайбкодер-разработчик и маркетолог с 9-летним опытом, основатель «Мандарин Лаб». Собирает на ИИ то, за что раньше платили подрядчикам сотни тысяч: CRM, ботов, автоматизации, монтаж. Одну из систем строил под агентство недвижимости с базой в 400 000 лидов. Теперь учит этому с нуля - как за вечер собрать свой инструмент через Claude Code и зарабатывать на нейросетях.
Telegram @mike_cmo →Кто такой Михаил Иванин →