← Лендинг Hermes Agent

Опубликовано

Локальные LLM на Android: что и зачем реально можно гонять на телефоне

Автор: Гусев Николай [портфолио]

Дата обновления не указана в исходнике.

Темы: local-models, android, on-device

Сложность: низкая

В прошлой статье я разбирал K2 Horizon - флот открытых моделей из ОАЭ с аудитом на reward hacking, который лаборатория провела над собой. Тогда я зацепился за младшую модель линейки: 0.9B в GGUF весит всего 2 GB, а заявленные результаты (48.5 на AIME 2026, 79.9 на HumanEval+) - уровень моделей в разы больше. Первая мысль была очевидной: это ведь на телефоне сможет работать. Стал копать глубже - и 0.9B оказался не пределом, а нижней ступенькой. За последние полгода компактный класс вырос так, что средний Android-флагман тянет модели уровня прошлогодних 7B. Подробно про K2 Horizon и его историю - в первой части, здесь - чистая практика: что, на чём и для чего можно запускать на Android.

Модели по классам RAM

Ключевая метрика - оперативка телефона, не параметры модели. Правило: файлу модели нужно места вдвое больше своего веса плюс запас на систему.

Бюджетные, 4 GB RAM

  • Qwen 3.5 0.8B - фаворит класса. Умеет tool use и RAG, по отзывам сообщества r/LocalLLaMA "значительно опережает аналоги от Google в своей весовой" и "работает у пользователя, который не знает про AI" (сводка AI-Stat).
  • Gemma 3 1B, SmolLM2 1.7B - запасные варианты, попроще.

Задачи: простые вопросы, короткий перевод, суммаризация заметок.

Средний класс, 6 GB RAM

  • Qwen 3.5 1.7B Q4_K_M - лучший баланс скорость/качество для большинства телефонов.
  • Gemma 4 E2B (эффективные 2B, файл ~2.5 GB) - единственный компактный вариант с нативной мультимодальностью: понимает изображения и речь. Через Google AI Edge Gallery работает в авиарежиме.

Задачи: полноценный чат, перевод, распознавание текста с фото, транскрибация голосовых.

Флагманы, 8+ GB RAM

  • Phi-4 Mini (Microsoft, 3.8B, Q4_K_M ~2.7 GB) - лучшее качество кода и рассуждений в классе, догоняет 7B-модели за счёт тренировки на синтетике от учительских моделей. Минус: tool calling урезан.
  • Gemma 4 E4B - как E2B, но точнее.
  • Qwen 3.5 4B - если важен русский и агентные сценарии.
  • Gemma 3 4B QAT Q6_K - проверенный вариант (QAT - обучение с учётом квантования, качество почти не деградирует).

Задачи: локальный ассистент, простой код, RAG по документам.

Топы, 12-16 GB RAM

  • 7-8B модели (Qwen3 7B Q4, Llama 4 8B) - влезут, но на средних чипах скорость падает до мучительных 2-3 tok/s. Флагманское железо с NPU - другое дело.

Чем гонять: шесть проверенных приложений

По свежему тесту шести приложений на Galaxy S25 Ultra, Pixel 9 Pro и OnePlus 13 (promptquorum, 2026):

  • PocketPal AI - лучший общий выбор. llama.cpp внутри, полный доступ к GGUF через интеграцию с Hugging Face, "Pals" с разными системными промптами, Vulkan (на MediaTek это плюс 30-40% к скорости), интеграция с Android share sheet.
  • Google AI Edge Gallery (официальное от Google, Play Store и GitHub) - самый простой вход. Каталог: Gemma 4 E2B/E4B, Gemma 3, Qwen 2.5 1.5B, DeepSeek R1 Distill 1.5B. Сценарии AI Chat, Ask Image (вопрос по фотографии), Audio Scribe (расшифровка звука). Android 12+, iOS 17+.
  • MLC Chat - самый быстрый, но только на Snapdragon 8 Elite: единственный доступ к Hexagon NPU (~40 tok/s на Qwen3 1.7B против 12-16 tok/s у CPU-путей). На MediaTek и Pixel бесполезен - падает в CPU без выгоды. Только каталог готовых моделей.
  • AnythingLLM - если нужен RAG: кидаешь PDF с телефона, отвечает по нему, всё локально. Есть поддержка MCP - начало мобильного агента. Умеет подключаться к большой модели на домашнем ПК через API.
  • Maid (F-Droid) - для де-гуглизированных прошивок (GrapheneOS, CalyxOS), любой GGUF через файловый менеджер.
  • Termux + Ollama - путь разработчика: полноценный OpenAI-совместимый API на телефоне, tool use, связь с другими приложениями. Только Termux из F-Droid.

Подводные камни

  • NPU у сторонних приложений работает только на Snapdragon 8 Elite и только в MLC Chat. Tensor G5 на Pixel отдаёт NPU только Google-сервисам - все приложения там CPU-only. MediaTek Dimensity - Vulkan GPU.
  • Xiaomi, Samsung, OnePlus убивают фоновые процессы: LLM-приложение нужно вручную исключить из оптимизации батареи (Samsung: Device Care - Battery - Sleeping Apps), иначе генерация обрывается на середине.
  • Модели хранить в приватной папке приложения, не в Downloads - иначе приложения их не увидят.
  • Тепло и батарея: sustained-инференс просаживает скорость на 20-30%, телефон греется. Это нормально, но не гонять часами.
  • Root не нужен нигде.

Проверка на своих задачах

Всё выше - по опубликованным тестам и сводкам, не по личному прогону. Модели обучены преимущественно на английском (Qwen традиционно сильнее в мультиязычности - 201 язык и словарь 250 тыс. токенов против 140 у Gemma), а на русском качество никто из вендоров не заявлял. Перед тем как встраивать в что-то - проверить на своих запросах: задать 10-15 типовых вопросов и посмотреть на галлюцинации.

Итог

Локальный ИИ на Android перестал быть экзотикой для гиков с рутованными телефонами. Сейчас это: PocketPal AI или Google AI Edge Gallery, модель на 0.8-4B под объём RAM (мой старт - Qwen 3.5 1.7B Q4_K_M), полный офлайн и нулевая отправка данных в облако. Модель из ОАЭ тут хорошая новость не сама по себе, а как знак: открытый трек малых моделей двигается, и телефон начинает тянуть то, что год назад требовало десктопа.

Первая часть про K2 Horizon, аудит бенчмарков и архитектуру MoVA: K2 Horizon: первая фронтир-линейка из ОАЭ.

Ссылки: тест приложений на Android, Gemma 4 на телефоне, Gemma 4 vs Qwen 3.5.