← Лендинг Hermes Agent

Опубликовано

Десять локальных моделей на RTX 4060: кто годится в агенты

Автор: Гусев Николай [портфолио]

Дата обновления не указана в исходнике.

Темы: local-models, benchmarks, yandexgpt

**Сложность: **средняя. Понадобится понимать, чем отличаются RAG, тулколлинг и reasoning, но все выводы привязаны к конкретным тестам и сценариям.

Неделю назад в посте "Бенчмарки врут красиво" был простой тезис: разница в три пункта из ста в публичной таблице часто означает шум, а self-reported цифры разработчика остаются заявлением, пока их не проверили на своей работе. Тогда же появился список моделей, которые хотелось прогнать руками.

План выполнен и расширен. Мы проверили 10 моделей на девяти одинаковых тестах, загружая в память строго по одной модели. Стенд один и тот же: RTX 4060 8 GB, квант Q4_K_M и LM Studio.

Главный результат получился практичнее любого общего рейтинга. Для локального русскоязычного агента первым кандидатом стал YandexGPT-5-Lite-8B, а среди моделей 2-4B неожиданно убедительно выступил Apollo-4B-Thinking. Но универсального победителя нет: Granite лучше ложится на код, SmolLM3 быстр, а Aion-RP вообще стоит держать подальше от агентного пайплайна.

Что показал класс около 8B

YandexGPT-5-Lite-8B и Granite-4.1-8b пришли почти к паритету. Первая лучше подходит для русского контура, вторая дает столь же ровный результат там, где язык и культурный контекст не критичны. Разница между средними 30 и 29 токенами в секунду сама по себе ничего не решает.

Gemma-4-E4B хорошо прошла культуру и диспетчер, но на первом русском тесте внутреннее рассуждение съело весь исходный бюджет токенов. Aion-RP справилась с фактами, однако в тесте T2 решила задачу сама вместо делегирования и оставляла в ответах служебные хвосты __USER__ и __ASSISTANT__.

`Модель                RU            Культура       RAG           Rust          DevOps        Диспетчер              Среднее
YandexGPT-5-Lite-8B   3/5 27.5 t/s  3/3 26.5 t/s   5/5 32.8 t/s  4/5 28.6 t/s  4/5 34.6 t/s  T1+T2+T3+T6 PASS       около 30 t/s
Granite-4.1-8b        3/5 26.3 t/s  3/3 25.3 t/s   5/5 29.6 t/s  4/5 31.2 t/s  4/5 30.9 t/s  T1+T2+T3+T6 PASS       около 29 t/s
Aion-RP-8b            3/5 28.1 t/s  2/3 27.4 t/s   5/5 26.2 t/s  4/5 30.0 t/s  3/5 33.3 t/s  T2 FAIL                 около 29 t/s
Gemma-4-E4B           0/5 28.3 t/s  3/3 29.8 t/s   3/5 31.7 t/s  4/5 30.8 t/s  4/5 32.1 t/s  T1+T2+T3+T6 PASS       около 31 t/s`

Ноль Gemma относится к ru-01: модель не дошла до финального ответа из-за исчерпанного бюджета, а не дала пять неверных ответов. Это важное различие между ошибкой модели и ошибкой измерительного контура.

Что умеют модели 2-4B

Apollo-4B-Thinking оказалась самым цельным маленьким участником. Она единственная в этом классе совместила русский язык и культуру, полный диспетчер, RAG и хороший результат в DevOps. Цена такого баланса заметна в скорости: около 23 t/s против 41-48 t/s у большинства соседей.

Granite-4.1-3b дала разумный компромисс между размером, скоростью и качеством. SmolLM3-3B выиграла тест Rust и показала 45 t/s, но провалила русскую культуру и два теста диспетчера. Qwen3.8-4B, MiniCPM5-2B и LiquidAI-2.6B тоже требуют узкой роли, а не надежды на универсальность.

`Модель                RU            Культура     RAG           Rust          DevOps        Диспетчер          Среднее
Apollo-4B-Thinking    4/5 24.0 t/s  3/3 24.3 t/s 5/5 23.0 t/s  4/5 23.0 t/s  5/5 22.1 t/s  T1+T2+T3+T6 PASS   около 23 t/s
Granite-4.1-3b        3/5 34.5 t/s  1/3 36.1 t/s 5/5 45.6 t/s  4/5 51.4 t/s  4/5 51.2 t/s  T1+T2+T3+T6 PASS   около 44 t/s
SmolLM3-3B            4/5 37.2 t/s  0/3 37.5 t/s 4/5 48.0 t/s  5/5 45.3 t/s  4/5 55.0 t/s  T1 FAIL, T3 FAIL   около 45 t/s
Qwen3.8-4B            2/5 30.2 t/s  0/3 34.7 t/s 3/5 42.5 t/s  4/5 50.0 t/s  5/5 47.5 t/s  T1 FAIL, T2 FAIL   около 41 t/s
MiniCPM5-2B           0/5 39.6 t/s  1/3 39.6 t/s 5/5 52.8 t/s  4/5 46.6 t/s  3/5 59.0 t/s  T1 FAIL, T3 FAIL   около 48 t/s
LiquidAI-2.6B         3/5 38.5 t/s  0/3 36.2 t/s 0/5 46.8 t/s  4/5 55.0 t/s  4/5 54.7 t/s  только T6 PASS     около 46 t/s`

Ошибка харнеса, которая обнулила хорошие модели

Первый прогон записал Gemma и Apollo в нули. Причина была не в моделях: thinking-версии возвращали рассуждение в поле reasoning_content, а скрипт искал reasoning. Финальный ответ не успевал появиться в прежнем лимите.

После исправления харнес читает оба поля и дает thinking-моделям тройной бюджет токенов.

Куда ставить каждую модель

YandexGPT-5-Lite-8B стоит брать первым кандидатом для локального русскоязычного агента. Она одинаково уверенно работает как RAG по русским документам и как диспетчер с русскими инструкциями, а затем ее уже можно проверять на данных конкретного проекта.

Granite-4.1-8b подходит для кода и быстрых агентных задач, где качество русского текста не определяет результат. Granite-4.1-3b решает похожие задачи примерно вдвое быстрее и требует примерно вдвое меньше памяти, но русская культура падает с 3/3 до 1/3.

Apollo-4B-Thinking хороша как маленький универсал. Это единственная модель 2-4B в прогоне, которая сохранила полный диспетчер и русскую культуру, однако для нее нужно заранее закладывать тройной бюджет токенов.

Qwen3.8-4B и SmolLM3-3B стоит рассматривать ради скорости, кода и тулколлинга в нерусском контуре. Обе ошибаются в диспетчерских сценариях, а тест русской культуры закрыли с результатом 0/3, поэтому автономный русский агент для них слишком широкая роль.

Aion-RP-8b оставляем для ролевых диалогов, ради которых она и настроена. В рабочем пайплайне служебные RP-хвосты и склонность решать задачу вместо делегирования быстро превращаются в поломку протокола.

LiquidAI-2.6B и MiniCPM5-2B полезны как быстрые исполнители задач по коду без требований к русскому языку. В роли диспетчера они ненадежны: MiniCPM провалила T1 и T3, а LiquidAI прошла только T6 и получила 0/5 за RAG.

Что делать с цифрами вендоров

Яндекс заявляет для YandexGPT 5 Lite лидерство среди зарубежных моделей того же размера в русскоязычных бенчмарках. Публичных следов для независимой проверки пока почти нет, поэтому уверенность в заявлении низкая. Наш узкий прогон не доказывает лидерство, но показывает паритет с Granite-4.1-8b на одном локальном стенде.

Итог

Если нужен русский локальный агент, начинать стоит с YandexGPT-5-Lite-8B. Если русский вторичен, Granite-4.1-8b дает почти тот же темп и ровное качество, а Granite-4.1-3b экономит память. Для маленького универсала лучшим сюрпризом стала Apollo-4B-Thinking, если харнес умеет читать reasoning и не душит модель коротким лимитом.

Остальные модели тоже нашли работу, но только после отказа от идеи единого рейтинга. Собственный прогон показал то, чего не видно в средней оценке: одна модель ломает делегирование, другая не знает русский культурный контекст, третья великолепно пишет Rust. Бенчмарк остается направлением поиска, а окончательный ответ дает только ваш сценарий.

Ссылки и материалы

YandexGPT-5-Lite-8B в GGUF: https://huggingface.co/yandex/YandexGPT-5-Lite-8B-instruct-GGUF

Пост 174 "Бенчмарки врут красиво": https://t.me/hermesagentru/174

Подписывайся: @hermesagentru