Опубликовано
Десять локальных моделей на RTX 4060: кто годится в агенты
Автор: Гусев Николай [портфолио]
Дата обновления не указана в исходнике.
Темы: local-models, benchmarks, yandexgpt
**Сложность: **средняя. Понадобится понимать, чем отличаются RAG, тулколлинг и reasoning, но все выводы привязаны к конкретным тестам и сценариям.
Неделю назад в посте "Бенчмарки врут красиво" был простой тезис: разница в три пункта из ста в публичной таблице часто означает шум, а self-reported цифры разработчика остаются заявлением, пока их не проверили на своей работе. Тогда же появился список моделей, которые хотелось прогнать руками.
План выполнен и расширен. Мы проверили 10 моделей на девяти одинаковых тестах, загружая в память строго по одной модели. Стенд один и тот же: RTX 4060 8 GB, квант Q4_K_M и LM Studio.
Главный результат получился практичнее любого общего рейтинга. Для локального русскоязычного агента первым кандидатом стал YandexGPT-5-Lite-8B, а среди моделей 2-4B неожиданно убедительно выступил Apollo-4B-Thinking. Но универсального победителя нет: Granite лучше ложится на код, SmolLM3 быстр, а Aion-RP вообще стоит держать подальше от агентного пайплайна.
Что показал класс около 8B
YandexGPT-5-Lite-8B и Granite-4.1-8b пришли почти к паритету. Первая лучше подходит для русского контура, вторая дает столь же ровный результат там, где язык и культурный контекст не критичны. Разница между средними 30 и 29 токенами в секунду сама по себе ничего не решает.
Gemma-4-E4B хорошо прошла культуру и диспетчер, но на первом русском тесте внутреннее рассуждение съело весь исходный бюджет токенов. Aion-RP справилась с фактами, однако в тесте T2 решила задачу сама вместо делегирования и оставляла в ответах служебные хвосты __USER__ и __ASSISTANT__.
`Модель RU Культура RAG Rust DevOps Диспетчер Среднее
YandexGPT-5-Lite-8B 3/5 27.5 t/s 3/3 26.5 t/s 5/5 32.8 t/s 4/5 28.6 t/s 4/5 34.6 t/s T1+T2+T3+T6 PASS около 30 t/s
Granite-4.1-8b 3/5 26.3 t/s 3/3 25.3 t/s 5/5 29.6 t/s 4/5 31.2 t/s 4/5 30.9 t/s T1+T2+T3+T6 PASS около 29 t/s
Aion-RP-8b 3/5 28.1 t/s 2/3 27.4 t/s 5/5 26.2 t/s 4/5 30.0 t/s 3/5 33.3 t/s T2 FAIL около 29 t/s
Gemma-4-E4B 0/5 28.3 t/s 3/3 29.8 t/s 3/5 31.7 t/s 4/5 30.8 t/s 4/5 32.1 t/s T1+T2+T3+T6 PASS около 31 t/s`
Ноль Gemma относится к ru-01: модель не дошла до финального ответа из-за исчерпанного бюджета, а не дала пять неверных ответов. Это важное различие между ошибкой модели и ошибкой измерительного контура.
Что умеют модели 2-4B
Apollo-4B-Thinking оказалась самым цельным маленьким участником. Она единственная в этом классе совместила русский язык и культуру, полный диспетчер, RAG и хороший результат в DevOps. Цена такого баланса заметна в скорости: около 23 t/s против 41-48 t/s у большинства соседей.
Granite-4.1-3b дала разумный компромисс между размером, скоростью и качеством. SmolLM3-3B выиграла тест Rust и показала 45 t/s, но провалила русскую культуру и два теста диспетчера. Qwen3.8-4B, MiniCPM5-2B и LiquidAI-2.6B тоже требуют узкой роли, а не надежды на универсальность.
`Модель RU Культура RAG Rust DevOps Диспетчер Среднее
Apollo-4B-Thinking 4/5 24.0 t/s 3/3 24.3 t/s 5/5 23.0 t/s 4/5 23.0 t/s 5/5 22.1 t/s T1+T2+T3+T6 PASS около 23 t/s
Granite-4.1-3b 3/5 34.5 t/s 1/3 36.1 t/s 5/5 45.6 t/s 4/5 51.4 t/s 4/5 51.2 t/s T1+T2+T3+T6 PASS около 44 t/s
SmolLM3-3B 4/5 37.2 t/s 0/3 37.5 t/s 4/5 48.0 t/s 5/5 45.3 t/s 4/5 55.0 t/s T1 FAIL, T3 FAIL около 45 t/s
Qwen3.8-4B 2/5 30.2 t/s 0/3 34.7 t/s 3/5 42.5 t/s 4/5 50.0 t/s 5/5 47.5 t/s T1 FAIL, T2 FAIL около 41 t/s
MiniCPM5-2B 0/5 39.6 t/s 1/3 39.6 t/s 5/5 52.8 t/s 4/5 46.6 t/s 3/5 59.0 t/s T1 FAIL, T3 FAIL около 48 t/s
LiquidAI-2.6B 3/5 38.5 t/s 0/3 36.2 t/s 0/5 46.8 t/s 4/5 55.0 t/s 4/5 54.7 t/s только T6 PASS около 46 t/s`
Ошибка харнеса, которая обнулила хорошие модели
Первый прогон записал Gemma и Apollo в нули. Причина была не в моделях: thinking-версии возвращали рассуждение в поле reasoning_content, а скрипт искал reasoning. Финальный ответ не успевал появиться в прежнем лимите.
После исправления харнес читает оба поля и дает thinking-моделям тройной бюджет токенов.
Куда ставить каждую модель
YandexGPT-5-Lite-8B стоит брать первым кандидатом для локального русскоязычного агента. Она одинаково уверенно работает как RAG по русским документам и как диспетчер с русскими инструкциями, а затем ее уже можно проверять на данных конкретного проекта.
Granite-4.1-8b подходит для кода и быстрых агентных задач, где качество русского текста не определяет результат. Granite-4.1-3b решает похожие задачи примерно вдвое быстрее и требует примерно вдвое меньше памяти, но русская культура падает с 3/3 до 1/3.
Apollo-4B-Thinking хороша как маленький универсал. Это единственная модель 2-4B в прогоне, которая сохранила полный диспетчер и русскую культуру, однако для нее нужно заранее закладывать тройной бюджет токенов.
Qwen3.8-4B и SmolLM3-3B стоит рассматривать ради скорости, кода и тулколлинга в нерусском контуре. Обе ошибаются в диспетчерских сценариях, а тест русской культуры закрыли с результатом 0/3, поэтому автономный русский агент для них слишком широкая роль.
Aion-RP-8b оставляем для ролевых диалогов, ради которых она и настроена. В рабочем пайплайне служебные RP-хвосты и склонность решать задачу вместо делегирования быстро превращаются в поломку протокола.
LiquidAI-2.6B и MiniCPM5-2B полезны как быстрые исполнители задач по коду без требований к русскому языку. В роли диспетчера они ненадежны: MiniCPM провалила T1 и T3, а LiquidAI прошла только T6 и получила 0/5 за RAG.
Что делать с цифрами вендоров
Яндекс заявляет для YandexGPT 5 Lite лидерство среди зарубежных моделей того же размера в русскоязычных бенчмарках. Публичных следов для независимой проверки пока почти нет, поэтому уверенность в заявлении низкая. Наш узкий прогон не доказывает лидерство, но показывает паритет с Granite-4.1-8b на одном локальном стенде.
Итог
Если нужен русский локальный агент, начинать стоит с YandexGPT-5-Lite-8B. Если русский вторичен, Granite-4.1-8b дает почти тот же темп и ровное качество, а Granite-4.1-3b экономит память. Для маленького универсала лучшим сюрпризом стала Apollo-4B-Thinking, если харнес умеет читать reasoning и не душит модель коротким лимитом.
Остальные модели тоже нашли работу, но только после отказа от идеи единого рейтинга. Собственный прогон показал то, чего не видно в средней оценке: одна модель ломает делегирование, другая не знает русский культурный контекст, третья великолепно пишет Rust. Бенчмарк остается направлением поиска, а окончательный ответ дает только ваш сценарий.
Ссылки и материалы
YandexGPT-5-Lite-8B в GGUF: https://huggingface.co/yandex/YandexGPT-5-Lite-8B-instruct-GGUF
Пост 174 "Бенчмарки врут красиво": https://t.me/hermesagentru/174
Подписывайся: @hermesagentru