Нейросеть на телефоне: гайд по Ornith-1.5 9B

Как запустить нейросеть на телефоне: гайд по Ornith-1.5 9B
19 августа 2026 года команда ornith-ai (проект DeepReinforce) выложила открытую модель Ornith-1.5 в трёх размерах: 397B, 35B и 9B под лицензией MIT. Именно версия 9B в квантизации GGUF реально запускается на флагманских смартфонах через приложение PocketPal AI - это первая опенсорс-модель уровня "уверенно кодит и рассуждает", которую можно носить в кармане без интернета.
Ниже - как это сделать пошагово, что действительно нужно от телефона и где заканчивается маркетинг.
Что реально запускается на телефоне, а что нет
В Telegram-каналах пишут "Qwen 3.6 35B на телефоне" - красивый заголовок, но неправда. Ornith-1.5-9B построен на архитектуре Qwen 3.5 (в конфиге модели значится Qwen35), а не Qwen 3.6. И на телефоне запускается именно 9B, а не 35B: 35B-версия рассчитана на GPU с 24 ГБ VRAM, любой телефон её просто не потянет.
На мобильном реально работает:
- Ornith-1.5-9B-GGUF в квантизации Q4_K_M - 5.63 ГБ на диске, требует ~7-8 ГБ свободной RAM.
- Ornith-1.5-9B-Mobile - отдельный вариант, дополнительно сжатый под мобильные устройства.
- Ornith-1.5-9B-MLX - для маков на Apple Silicon (17.9 ГБ, не для айфонов).
То есть на телефоне реально гоняется 9B - и это уже мощно. У неё контекст 256 000 токенов, встроенный ризонинг (модель думает в блоках <think>...</think> перед ответом) и tool calling.
Что такое Ornith-1.5 и в чём фишка
Ornith-1.5 - это self-improving модель под кодинг и агентские задачи. Главная особенность в обучении: она сама предлагает себе задачи, сама строит под них скаффолд (мини-план работы), сама генерит решения - и на этом дообучается через reinforcement learning. Отсюда и "самосовершенствующаяся": авторы прогнали цикл end-to-end.
В работе это даёт две вещи. Первое - модель хорошо декомпозирует задачу на подзадачи и перепроверяет саму себя. Второе - она стабильно ведёт длинные цепочки рассуждений про код и не сыпется на многошаговых сценариях. Для 9B это редкое сочетание.
Весь стек лежит на HuggingFace: ornith-ai/Ornith-1.5-9B-GGUF.
Что нужно от телефона
- Оперативка: минимум 8 ГБ, комфортно от 12 ГБ. iPhone 15 Pro / Pro Max, Samsung Galaxy S24 Ultra, Pixel 8 Pro и выше - тянут. Средний класс с 6 ГБ RAM 9B не потянет, там максимум модели на 1-2B.
- Место: 6-10 ГБ свободного места под квантизацию Q4_K_M или Q5_K_M.
- Скорость: на флагмане с NPU (Apple A17 Pro / Snapdragon 8 Gen 3) 9B выдаёт 3-8 токенов в секунду. Не молниеносно, но пишет быстрее, чем читаешь.
Если телефон попроще - смотри в сторону моделей на 1.7-4B: Qwen 3 1.7B, Gemma 3 1B, Phi-4-mini. Они разгоняются до 10-40 токенов в секунду даже на среднем железе.
Как поставить на iPhone и Android: PocketPal AI
Стандартный способ - PocketPal AI, бесплатное опенсорс-приложение на базе llama.cpp. Есть в App Store и Google Play. Внутри Metal-ускорение на iOS, OpenCL и Qualcomm Hexagon NPU на Android.
Шаги:
- Ставишь PocketPal AI из магазина.
- Открываешь вкладку Models → Add from Hugging Face.
- В поиск вбиваешь
ornith-ai/Ornith-1.5-9B-GGUF. - Выбираешь файл нужной квантизации (см. следующий раздел).
- Ждёшь загрузку (5-10 ГБ через Wi-Fi - минут 15-30).
- Тапаешь Load и начинаешь чатиться.
Интернет после загрузки не нужен - модель работает офлайн, ничего не уходит в облако. Это буквально твой личный ChatGPT в кармане.
Какую квантизацию выбрать
Квантизация - степень сжатия модели. Чем сильнее сжата, тем меньше файл и быстрее генерация, но тем хуже качество. Для Ornith-1.5-9B-GGUF доступны:
| Квантизация | Размер | Когда брать |
|---|---|---|
| Q4_K_M | 5.63 ГБ | Универсальный дефолт для телефона |
| Q5_K_M | 6.47 ГБ | Если есть 12+ ГБ RAM и хочется чуть лучше |
| Q6_K | 7.36 ГБ | Для флагманов с 16 ГБ, качество почти как оригинал |
| Q8_0 | 9.53 ГБ | Только для десктопа, не для телефона |
| BF16 | 17.9 ГБ | Оригинал, для сервера с GPU |
Совет по практике: на iPhone 15 Pro бери Q4_K_M - работает стабильно, ответы адекватные, батарея не садится за час. На Q5_K_M телефон ощутимо теплее.
Как я прогнал модель и что вышло
Поставил Ornith-1.5-9B-GGUF Q4_K_M на iPhone 15 Pro через PocketPal AI. Скачал файл за 22 минуты по домашнему Wi-Fi. Загрузка модели в память - около 30 секунд. Первый тест: попросил переписать питоновский скрипт из 60 строк с обработкой ошибок и типизацией. Модель выдала рабочий код за минуту с небольшим (скорость ~5 токенов/сек), с корректными try/except и type hints.
Вопрос на русском ("объясни механизм внимания в трансформерах") - ответ на уровне толкового технического обзора, без выдумок. Математическая задача с рассуждением - модель ушла в <think> блок, разложила по шагам и дала верный ответ.
Один нюанс: на длинных ответах (200+ токенов) телефон греется. За 5-6 полноценных диалогов подряд батарея сожралась процентов на 20. Для разовых задач нормально, для постоянной работы - лучше держать на подзарядке.
Для кого это и для кого нет
Кому реально пригодится:
- Разработчику, который часто в дороге и нужен помощник по коду офлайн.
- Тому, кто не хочет отдавать чувствительные данные в облако (пациенты, клиенты, юридика).
- Автору контента - можно диктовать идеи и просить структурировать без интернета.
Кому это не нужно:
- Если дома нормальный интернет и не жалко $20 в месяц на ChatGPT/Claude - облако быстрее и умнее.
- Если телефон среднего класса - 9B на нём не поедет, бери модель поменьше.
Для кодеров: подготовить модель через Claude Code
Если хочешь сначала скачать модель на комп, проверить и потом закинуть на телефон - вставь в Claude Code запрос:
Скачай через huggingface-cli модель ornith-ai/Ornith-1.5-9B-GGUF файл Q4_K_M (~5.6 GB) в папку ~/models. Проверь целостность файла, покажи размер и SHA256. Дальше подскажи, как перекинуть его на iPhone через AirDrop в приложение PocketPal AI и на Android через USB в папку Downloads.
Claude сам поставит huggingface-cli, залогинит по токену и разложит файлы. Если Claude Code для тебя в новинку - начни с гайда для новичков.
Частые вопросы
Реально ли запускается Qwen 3.6 35B на телефоне?
Нет. На телефоне запускается Ornith-1.5-9B (на архитектуре Qwen 3.5), а не 35B и не 3.6. Модель на 35B требует серверную GPU минимум с 24 ГБ VRAM.
Нужен ли интернет после установки?
Нет. Модель полностью локальная, работает офлайн. Данные не уходят в облако - главная причина запускать LLM на телефоне.
Сколько это ест батареи?
За час активного диалога с 9B на iPhone 15 Pro - около 20-25% заряда. Телефон греется на длинных ответах. Для эпизодического использования норм, для постоянного - держи на зарядке.
Есть ли русский язык?
Да. Ornith-1.5 обучалась на многоязычном корпусе, русский держит на уровне свободного разговора и технического текста. Специализирована в первую очередь на кодинге и агентах, но и общие вопросы отвечает адекватно.
Что лучше - Ornith-1.5 9B или облачный ChatGPT?
Для сложных задач ChatGPT сильнее (у него модель на порядок больше). Для приватных данных, работы офлайн и быстрых вопросов на ходу - Ornith-1.5 удобнее. Это разные инструменты, а не замена одного другого.
Коротко
Ornith-1.5-9B - первая опенсорс-модель с ризонингом и кодингом, которую реально можно гонять на флагманском смартфоне через PocketPal AI. Работает офлайн, контекст 256K, лицензия MIT. Не 35B, не Qwen 3.6 - но 9B на iPhone 15 Pro пишет рабочий код за пару минут без интернета. Для приватности и работы в дороге - настоящий шаг вперёд.
Что дальше
Если хочешь собрать такую систему у себя - у меня есть курс по вайбкодингу и работе с нейросетями в клубе Мандарин Лаб: mandarinedu.ru. Первые уроки открыты бесплатно.
Если нужно внедрить ИИ в бизнес - процессы, агентов, автоматизацию под вашу задачу - пишите мне напрямую: t.me/Philigranchik. Разберу задачу и скажу, что реально автоматизируется, а что нет.

Вайбкодер-разработчик и маркетолог с 9-летним опытом, основатель «Мандарин Лаб». Собирает на ИИ то, за что раньше платили подрядчикам сотни тысяч: CRM, ботов, автоматизации, монтаж. Одну из систем строил под агентство недвижимости с базой в 400 000 лидов. Теперь учит этому с нуля - как за вечер собрать свой инструмент через Claude Code и зарабатывать на нейросетях.
Telegram @mike_cmo →Кто такой Михаил Иванин →