Опубликовано
Локальные LLM на Android: что и зачем реально можно гонять на телефоне
Автор: Гусев Николай [портфолио]
Дата обновления не указана в исходнике.
Темы: local-models, android, on-device
Сложность: низкая
В прошлой статье я разбирал K2 Horizon - флот открытых моделей из ОАЭ с аудитом на reward hacking, который лаборатория провела над собой. Тогда я зацепился за младшую модель линейки: 0.9B в GGUF весит всего 2 GB, а заявленные результаты (48.5 на AIME 2026, 79.9 на HumanEval+) - уровень моделей в разы больше. Первая мысль была очевидной: это ведь на телефоне сможет работать. Стал копать глубже - и 0.9B оказался не пределом, а нижней ступенькой. За последние полгода компактный класс вырос так, что средний Android-флагман тянет модели уровня прошлогодних 7B. Подробно про K2 Horizon и его историю - в первой части, здесь - чистая практика: что, на чём и для чего можно запускать на Android.
Модели по классам RAM
Ключевая метрика - оперативка телефона, не параметры модели. Правило: файлу модели нужно места вдвое больше своего веса плюс запас на систему.
Бюджетные, 4 GB RAM
- Qwen 3.5 0.8B - фаворит класса. Умеет tool use и RAG, по отзывам сообщества r/LocalLLaMA "значительно опережает аналоги от Google в своей весовой" и "работает у пользователя, который не знает про AI" (сводка AI-Stat).
- Gemma 3 1B, SmolLM2 1.7B - запасные варианты, попроще.
Задачи: простые вопросы, короткий перевод, суммаризация заметок.
Средний класс, 6 GB RAM
- Qwen 3.5 1.7B Q4_K_M - лучший баланс скорость/качество для большинства телефонов.
- Gemma 4 E2B (эффективные 2B, файл ~2.5 GB) - единственный компактный вариант с нативной мультимодальностью: понимает изображения и речь. Через Google AI Edge Gallery работает в авиарежиме.
Задачи: полноценный чат, перевод, распознавание текста с фото, транскрибация голосовых.
Флагманы, 8+ GB RAM
- Phi-4 Mini (Microsoft, 3.8B, Q4_K_M ~2.7 GB) - лучшее качество кода и рассуждений в классе, догоняет 7B-модели за счёт тренировки на синтетике от учительских моделей. Минус: tool calling урезан.
- Gemma 4 E4B - как E2B, но точнее.
- Qwen 3.5 4B - если важен русский и агентные сценарии.
- Gemma 3 4B QAT Q6_K - проверенный вариант (QAT - обучение с учётом квантования, качество почти не деградирует).
Задачи: локальный ассистент, простой код, RAG по документам.
Топы, 12-16 GB RAM
- 7-8B модели (Qwen3 7B Q4, Llama 4 8B) - влезут, но на средних чипах скорость падает до мучительных 2-3 tok/s. Флагманское железо с NPU - другое дело.
Чем гонять: шесть проверенных приложений
По свежему тесту шести приложений на Galaxy S25 Ultra, Pixel 9 Pro и OnePlus 13 (promptquorum, 2026):
- PocketPal AI - лучший общий выбор. llama.cpp внутри, полный доступ к GGUF через интеграцию с Hugging Face, "Pals" с разными системными промптами, Vulkan (на MediaTek это плюс 30-40% к скорости), интеграция с Android share sheet.
- Google AI Edge Gallery (официальное от Google, Play Store и GitHub) - самый простой вход. Каталог: Gemma 4 E2B/E4B, Gemma 3, Qwen 2.5 1.5B, DeepSeek R1 Distill 1.5B. Сценарии AI Chat, Ask Image (вопрос по фотографии), Audio Scribe (расшифровка звука). Android 12+, iOS 17+.
- MLC Chat - самый быстрый, но только на Snapdragon 8 Elite: единственный доступ к Hexagon NPU (~40 tok/s на Qwen3 1.7B против 12-16 tok/s у CPU-путей). На MediaTek и Pixel бесполезен - падает в CPU без выгоды. Только каталог готовых моделей.
- AnythingLLM - если нужен RAG: кидаешь PDF с телефона, отвечает по нему, всё локально. Есть поддержка MCP - начало мобильного агента. Умеет подключаться к большой модели на домашнем ПК через API.
- Maid (F-Droid) - для де-гуглизированных прошивок (GrapheneOS, CalyxOS), любой GGUF через файловый менеджер.
- Termux + Ollama - путь разработчика: полноценный OpenAI-совместимый API на телефоне, tool use, связь с другими приложениями. Только Termux из F-Droid.
Подводные камни
- NPU у сторонних приложений работает только на Snapdragon 8 Elite и только в MLC Chat. Tensor G5 на Pixel отдаёт NPU только Google-сервисам - все приложения там CPU-only. MediaTek Dimensity - Vulkan GPU.
- Xiaomi, Samsung, OnePlus убивают фоновые процессы: LLM-приложение нужно вручную исключить из оптимизации батареи (Samsung: Device Care - Battery - Sleeping Apps), иначе генерация обрывается на середине.
- Модели хранить в приватной папке приложения, не в Downloads - иначе приложения их не увидят.
- Тепло и батарея: sustained-инференс просаживает скорость на 20-30%, телефон греется. Это нормально, но не гонять часами.
- Root не нужен нигде.
Проверка на своих задачах
Всё выше - по опубликованным тестам и сводкам, не по личному прогону. Модели обучены преимущественно на английском (Qwen традиционно сильнее в мультиязычности - 201 язык и словарь 250 тыс. токенов против 140 у Gemma), а на русском качество никто из вендоров не заявлял. Перед тем как встраивать в что-то - проверить на своих запросах: задать 10-15 типовых вопросов и посмотреть на галлюцинации.
Итог
Локальный ИИ на Android перестал быть экзотикой для гиков с рутованными телефонами. Сейчас это: PocketPal AI или Google AI Edge Gallery, модель на 0.8-4B под объём RAM (мой старт - Qwen 3.5 1.7B Q4_K_M), полный офлайн и нулевая отправка данных в облако. Модель из ОАЭ тут хорошая новость не сама по себе, а как знак: открытый трек малых моделей двигается, и телефон начинает тянуть то, что год назад требовало десктопа.
Первая часть про K2 Horizon, аудит бенчмарков и архитектуру MoVA: K2 Horizon: первая фронтир-линейка из ОАЭ.
Ссылки: тест приложений на Android, Gemma 4 на телефоне, Gemma 4 vs Qwen 3.5.