← Лендинг Hermes Agent

Опубликовано

Бенчмарки врут красиво: 6 локальных моделей на выходные под 8 GB VRAM

Автор: Гусев Николай [портфолио]

Дата обновления не указана в исходнике.

Темы: local-models, benchmarks, vram

Гусев Николай · сентябрь 2026

Часть 1. Про цифры 70.6 против 67.3

Знакомая картина: выходит флагман, пресс-релиз пишет "на 3 пункта лучше конкурента", твиттер разносит скриншоты таблиц, и все уже "поняли", что новая модель вдвое умнее.

Открой таблицу. Разница - 3 пункта. Из 100. Погрешность прогона - плюс-минус те же 3 пункта. Разные харнессы, разные промпты, разные температуры. Иногда и сами бенчмарки разные, а сравнение уже растиражировано.

Классика жанра: одна модель набрала 46 в Terminal-Bench, другая 52. В пресс-релизе второй - "значительный отрыв". В реальности это две модели, которые решают примерно каждую вторую задачу и примерно каждую вторую с половиной. На твоих задачах разницы ты не заметишь. Зато заметишь разницу в 15 токенов в секунду, о которой в таблице ни слова.

Почему так происходит - экономика. Модель невозможно продать фразой "примерно такая же, как прошлая". А таблицу с правильно выбранным срезом - можно. Выбирают бенчмарк, где отрыв максимальный. Кодинг-модели проверяют на кодинг-наборах, где они и выигрывают. Проигравшие метрики в карточку не включают - это не ложь, это "выборочная подача". Прочитал модельную карточку и поверил всем цифрам - поздравляю, ты прочитал рекламный буклет.

Ещё один приём: self-reported результаты. Модель X набрала 70.6 в SWE-bench - по данным команды X, на их харнессе, с их промптами. Проверить быстро нельзя, воспроизвести - дороже, чем поверить. Не значит, что наврали. Значит, что это заявление, а не измерение.

Отсюда первое правило выходных: бенчмарк - это направление поиска, а не ответ. Цифра говорит "тут стоит копать". Копать - руками, на своих задачах.

Часть 2. Что метрики значат в реальной жизни

Чтобы сравнивать модели руками, нужно понимать, что именно проверяют популярные наборы. Коротко, без магии.

BFCL-v4 (function calling). Дают модели инструменты и задачу. Она должна решить, вызывать ли инструмент, и заполнить аргументы валидным JSON. Провал - неправильная схема, лишний вызов, выдуманный параметр. В жизни это "агент вызывает тул правильно или ломает пайплайн". Если модель набирает 60 - каждая третья-четвёртая обработка тулов пойдёт криво, обвязка обязана валидировать.

Terminal-Bench (агент в терминале). Модель получает контейнер, bash и задачу "почини сборку". Считается доля задач, решённых полностью. Это самая честная проверка автономного кодинга: либо тесты зелёные, либо нет. 30 - агент-стажёр, нужен присмотр. 45-50 - уже можно давать задачи целиком.

TAU-bench (многоходовый агент). Симуляция службы поддержки: у агента есть база клиентов и API, задача решается за 10-30 шагов диалога. Оценивает не "умную" модель, а выносливую: не забыть цель, не выдумать баланс клиента, не зациклиться. Метрика, которая лучше всех предсказывает, переживёт ли агент длинную сессию, не разучившись по дороге.

GPQA Diamond (рассуждение). Вопросы уровня PhD по физике, химии, биологии. Нагуглить нельзя, нужно рассуждать. Высокий балл означает, что режим thinking у модели настоящий, а не декоративный: она умеет многошагово разбирать задачу, а не имитировать рассуждение.

Multi-IF (следование инструкциям). Сложные многошаговые предписания: форматы, ограничения, комбинации. В жизни это "система промптов агента соблюдается или игнорируется". Низкий балл - модель под страхом смерти должна выдавать JSON, но выдаёт markdown.

AA-Omniscience, non-hallucination rate. Доля ответов "не знаю" вместо выдуманного факта на незнакомых вопросах. Метрика, которую все игнорируют. Модель с 50% честности врёт уверенно ровно там, где ты не проверяешь. Модель с 70% хотя бы предупреждает.

Теперь заметь: в пресс-релизах эти метрики не различают. "Модель умнее" - а в какой из шести осей? Модель может быть гением function calling и слабаком в многоходовых сессиях. Или наоборот. Таблица из одного числа - это всегда реклама.

Часть 3. Что делать в выходные: шесть моделей под 8 GB

Железо - обычная игровая карта с 8 GB VRAM (RTX 3060 Ti / 4060 / аналоги). Всё гоняется через LM Studio или llama.cpp. Кванты - от bartowski, который квантует почти всё свежее на Hugging Face, с imatrix-калибровкой. Файл до ~6 GB влезает в VRAM целиком с запасом на контекст.

Дальше - что взял, зачем, и какой сценарий для проверки. Никаких "я всё протестировал": прогонял часть, остальное - по карточкам и цифрам сообщества. Цель текста - дать тебе план теста на один вечер, а не заменить его.

1. Ling-3.0-tiny (MoE, файл Q4_K_M 4.9 GB)

Кто сделал: inclusionAI (Ant Group). 7.9B общих параметров, активных 1.3B на токен - 128 экспертов, работают 8+1. Гибридное рассуждение: режим thinking включается на запрос, для простых вопросов можно выключить.

Цифры от разработчика: GPQA Diamond 73.4 (уровень моделей в разы больше), TAU-banking 20.8 против 7-9 у dense-конкурентов, BFCL-v4 62.7. Худший результат - Terminal-Bench 27.7: автономный кодинг не её.

Сценарий проверки: агентская цепочка. Дай модели задачу на 15-20 шагов с инструментами (прочитай файл - посчитай - запиши результат) и смотри, деградирует ли к 10-му шагу. Скорость должна ощущаться как у маленькой модели, качество ответов - как у заметно большей. Время на тест: полчаса.

2. Ornith-1.5-9B (dense, IQ4_XS 5.2 GB)

Кто сделал: ornith-ai. Главная заявка - самосовершенствование: модель генерирует себе обучающие задачи сама, строит харнессы, дообучается через RL без ручной разметки. Позиционируется как кодинг-агент: Terminal-Bench 46-47 (self-reported, по их харнессу Qwen3.5-9B набирает всего 21 - верить или нет, решай сам). Бонус - мультимодальность через mmproj-файл.

Сценарий проверки: терминальный кодинг. Дай ей через любую обвязку (aider, свой скрипт) три реальных бага из своих проектов - не выдуманных. Сравни с облачным ассистентом, которым пользуешься. 46 в бенчмарке означает примерно каждую вторую задачу. Если решает хотя бы одну из трёх чисто - для локального арсенала неплохо. Время: вечер.

3. Aion-RP-Llama-3.1-8B (dense, Q4_K_M 4.9 GB)

Кто сделал: aion-labs. Uncensored файнтюн Llama-3.1-8B под ролевую игру и креативное письмо. Полный контекст 131K. Ничего революционного - но стабильный, проверенный, с характером.

Сценарий проверки: длинный креатив. Скинь модели 50K контекста (черновик, переписку, документ) и попроси продолжение в заданном стиле. Смотри на две вещи: держит ли стиль на длинной дистанции и не начинает ли приглаживать и цензурировать ответ на 20-м абзаце. Температуру держи 0.7 - при 1.0 начинается словесный салат. Время: полчаса.

4. agentflow-planner-7b (Q4_K_M 4.7 GB)

Кто сделал: команда Pan Lu (Stanford, автор бенчмарка MMMU) в рамках проекта AgentFlow. Это не чат-бот: веса специализированы под планирование в агентских системах поверх Qwen2.5-7B-Instruct. Растёт быстрее всех в подборке - сообщество его разбирает под свои пайплайны.

Сценарий проверки: декомпозиция. Дай сложную задачу ("разберись, почему деплой падает, и составь план из шагов") без инструментов, только текст. Сравни план с тем, что выдаёт универсальная модель того же размера. Если планы структурнее и без выдуманных шагов - модель реально специализирована, можно пробовать её как "мозг" поверх более тупых исполнителей. Время: полчаса.

5. CogEvol-4B (Q8_0 4.5 GB, VLM)

Кто сделал: Tsinghua (THU-MAIC). Заточена под генерацию учебных артефактов: на вход - бриф курса, на выходе - готовая интерактивная HTML-страница или слайды в JSON. Обучена на 53K проверенных сэмплах, награда за "интерактивность" измеряется автоматическими пробами, а не оценкой второй моделью - от взлома системы наград отдельно защищались.

Малыш: 4-5B параметров, в 8 GB влезает даже в Q8_0 без потери качества.

Сценарий проверки: "сделай мне интерактивную визуализацию X" - алгоритм сортировки, график из твоих данных, форму с валидацией. Открыл HTML в браузере, посмотрел, работает ли. Карточка обещает генерацию за один проход. Проверишь за десять минут. Если каждая вторая страница живая - уже полезно.

6. Apollo-V0.1-4B-Thinking (Q6_K ~3.1 GB)

Кто сделал: AllThingsIntel. Файнтюн Qwen3-4B-Thinking с идеей "reasoning в персонаже": не просто отвечает от лица персонажа, а рассуждает в его стиле - цепочки мыслей тоже в характере. Для игр, интерактивной художки, обучения через сократовские вопросы.

Сценарий проверки: система-промпт с подробной персоной (не "ты полезный ассистент", а живой характер с привычками и биографией) - и длинный диалог. Смотри, держится ли образ в том числе в thinking-трейсах, и не скатывается ли в карикатуру после 10 сообщений. Время: полчаса, удовольствие гарантировано, даже если модель не пригодится для работы.

Бонус: ежедневный стек - LFM2.5-VL-3B и Granite-4.1-3B

Шесть моделей выше - эксперименты на выходные. Но в LM Studio у меня постоянно живут две, и они заслуживают упоминания отдельно от гонки за свежим.

LFM2.5-VL-3B от Liquid AI - локальные глаза. Мультимодальная, 16 языков включая русский, укладывается в 3.3 GB памяти целиком. Читает целые страницы с OCR и разметкой layout, находит объекты по текстовому запросу, понимает скриншоты интерфейсов. Когда нужно быстро "посмотреть" на чек, скрин или панель - это к ней, и облако не нужно.

Granite-4.1-3B от IBM - локальный исполнитель. Dense 3B под Apache-2.0, пост-тренинг заточен под tool calling, следование инструкциям и RAG. Она не рассуждает блестяще - она чётко исполняет плейбук: извлекла структуру в JSON, вызвала инструмент с правильными аргументами, отчиталась по формату.

Вместе они закрывают нижний этаж агентного стека: perception плюс execution. Наверху - планирование и рассуждение (Ling из первого задания или облако). Трёхуровневый локальный стек в 8 GB VRAM - это уже не игрушка, а рабочий инструмент.

Харнесс с заданиями для обеих - в файле 07 комплекта.

Часть 4. Метод теста - важнее моделей

Несколько правил, которые сэкономят время.

Свой набор задач. Возьми 5-10 реальных задач из своей недели: письмо, разбор лога, ревью кода, таблица. Не задачи из бенчмарков - на них модель уже натренирована (contamination - реальная проблема открытых наборов).

Одинаковые условия. Один рантайм, один контекст, одна температура для всех. Иначе сравниваешь не модели, а настройки.

Считай две вещи: качество ответа (грубо: годится/докрутить/мусор) и токенов в секунду. Вторая цифра на бытовом железе решает чаще первой - нетерпеливый человек не будет пользоваться умной, но медленной моделью.

Записывай сразу. Через день впечатления перемешаются в "что-то одно было лучше". Таблица из трёх колонок (модель, задача, вердикт) - достаточна.

Ловушка квантов: не сравнивай Q4 одной модели с Q4 другой как "качество моделей". Это качество моделей после сжатия. Разные архитектуры по-разному деградируют при квантовании. Для честного сравнения тяжёлых моделей бери максимально возможный квант, который влезает.

Итог

Бенчмарк - это не вердикт, это наводка. Одна модель на 7 пунктов круче другой в таблице ничего не значит, если разница - 7 из 100, харнессы разные, а данные - self-reported, без независимой проверки. Зато значат скорость на твоем железе, поведение на твоих задачах и честность на незнакомых вопросах.

Шесть моделей выше закрывают шесть разных сценариев: агентская работа, терминальный кодинг, длинный креатив, планирование, генерация артефактов, ролевая игра. Один вечер - и у тебя будет не "модель из топа", а инструмент под задачу.

Если что-то из этого прогонишь - напиши, что вышло. Особенно интересно по Ornith: цифры у них красивые, но self-reported - живая проверка от сообщества дороже любого пресс-релиза.

Материалы и сервисы

Харнесс целиком - карточки моделей, ссылки на кванты, параметры LM Studio и задания с критериями - лежит в открытом репозитории: GitHub, зеркало для РФ: GitFlic. Папка 2026-09-05-local-models-8gb.

Наши сервисы: pii-guard.ru (шлюз с защитой персональных данных), llm.pii-guard.ru (LLM-шлюз для корпоративных задач), hermes-agent.ru (агентная автоматизация), shturman.ai (управление задачами и встречами).

Сотрудничество, вопросы, предложения - Telegram: @sneg1313.