← Лендинг Hermes Agent

Опубликовано

Русский токенизатор GigaChat против open-моделей: замер на 519 живых запросах

Автор: Гусев Николай [портфолио]

Дата обновления не указана в исходнике.

Темы: gigachat, tokenizers, benchmarks

Все измерения выполнялись 12 сентября 2026 через реальные API: GigaChat PERS Freemium (6 моделей) и OpenCode Go подписка (8 моделей). Никаких бумажных цифр из пресс-релизов: только usage-поля из ответов на одинаковые промпты. Полный код и сырые данные опубликованы в channel-materials.

Контекст простой. Сбер даёт физлицам 365 млн токенов на год бесплатно, распределённых по четырём пулам: Lite 250М, Ultra 50М, Pro 40М, Max 25М. OpenCode Go и OpenRouter free-модели дают альтернативу без токенов вообще: платишь подпиской и жмёшь сколько влезет. Возникает инженерный вопрос: на токенах Сбера внутри Freemium реально влезает больше русской работы, чем на бесплатных аналогах? Ответ - да, и разрыв больше, чем я ожидал.

Как строился замер

Две ключевые ловушки при сравнении моделей, которые я обошёл.

Первая: нельзя сравнивать "модель с красивым именем" против "модели с другим красивым именем" - у них разные классы задач. В матрицу шли только пары, у которых совпадает MERA-скор или репрезентативный бенчмарк. GigaChat-2 (MERA 0.541) сравнивал с Qwen3-30B-A3B-2507 (MERA 0.492) - это прямой конкурент. GigaChat-3-Ultra (702B-A36B) - с grok-4.6 и kimi-k3, потому что других открытых моделей такой лиги в free просто нет.

Вторая: у бесплатных моделей лимиты free-роутов разные. Tencent-модели с OpenRouter выдают 20 запросов в минуту - на 38 задач уйдёт вечность. OpenCode Go даёт модели за подписку - работает без доплат.

В наборе 38 задач пяти категорий: factcheck с ловушками (несуществующие статьи ТК РФ, выдуманные штрафы), writing - тексты, в которых задана строгая структура ответа, многошаговое reasoning, format (JSON/таблицы/строгий счёт) и tokenize - короткие тексты разных жанров. Каждая задача прогнана на каждой модели с фиксацией usage. Ничего не пересобирала, ничего не переизмеряла: одна отправка = минимум два измерения (prompt_tokens и completion_tokens).

Токенизация: Сбер сжимает русский текст в 2-9 раз

Это главная цифра статьи, и она честно вызывала у меня недоверие, пока не сверил usage тремя разными способами.

Один и тот же русский текст разных жанров подаётся каждой модели. Смотрю prompt_tokens - сколько токенов каждая насчитала на вход.

Текст: Определение sunglasses | GigaChat-3 (любая из трёх): 23 | glm-5.3: 23 | qwen3.8-flash: 73 | deepseek-flash: 42 | kimi-k3: 103 | grok-4.6: 217
Текст: Хозяйственная переписка | GigaChat-3 (любая из трёх): 55 | glm-5.3: 71 | qwen3.8-flash: 116 | deepseek-flash: 94 | kimi-k3: 161 | grok-4.6: 261
Текст: Тех-док по конфигу | GigaChat-3 (любая из трёх): 60 | glm-5.3: 61 | qwen3.8-flash: 109 | deepseek-flash: 81 | kimi-k3: 149 | grok-4.6: 249

Разница между тройкой GigaChat-3 (Lightning, Pro, Ultra - у них общий токенизатор) и qwen - около 2x. С kimi-k3 - 3x. С grok-4.6 - 9x, причём grok через OpenAI Responses API добавляет служебный префикс ~200 токенов к любому промпту, это инженерная деталь, но она бьёт по малым запросам сильнее всего.

Что это значит в деньгах Freemium. Твои 250 млн токенов Lite-пула при токенизации GigaChat - это фактически в 2-3 раза больше реального русского контента, чем 250 млн токенов на китайских моделях. На практическом уровне: OAuth-запрос к Qwen на 5 строк текста съест то же, что GigaChat на абзац.

Короткие ответы: GigaChat не растекается

Второй замер - completion_tokens на задачах, где ответ по определению короткий. "Язык программирования, созданный Гвидо ван Россумом?" Если модель отвечает "python" - это 2-3 токена. Если она любит порассуждать - 80-300.

Модель: GigaChat-3 (любая) | completion на "python": 2 | completion на "logging": 2
Модель: GigaChat-2 | completion на "python": 3 | completion на "logging": 3
Модель: glm-5.3-flash | completion на "python": 8 | completion на "logging": 6
Модель: deepseek-v4.1-flash | completion на "python": 97 | completion на "logging": 38
Модель: qwen3.8-flash | completion на "python": 78 | completion на "logging": 74
Модель: grok-4.6 | completion на "python": 275 | completion на "logging": 223
Модель: kimi-k3 | completion на "python": 66 | completion на "logging": 75

GigaChat возвращает ровно то, что спрашивают, и ничего сверху. Это не про "русский", это про то, что модель не "болтает" вокруг ответа. В агентных конвейерах, где вызовов тысячи, эта разница стоит реальных денег.

Задержка отклика: Lightning против медленных гигантов

Тот же набор задач, средняя задержка отклика по категории. GigaChat-3-Lightning - король скорости: factcheck 1.4 с, format 0.8 с, writing 0.9 с. Это значит, что для интерактивных сценариев (чат-бот, обработка заявок) RF-модель быстрее максимально доступного grok-4.6 в 6 раз и qwen3.8-max в 10 раз.

Не всё в пользу Сбера. На многошаговом reasoning (арифметика, логика) китайские MoE-модели стабильнее: deepseek-flash, glm-5.3, kimi-k3 дают 87-88% по чекеру против 62-77% у GigaChat-2/3. Именно reasoning-задачи у Сбера - известная MERA-ловушка: RF-модели заметно умнее на российском корпусе, но на абстрактных задачах проигрывают конкурентам.

Продолжаем разбирать 519 валидных запросов. В первой части - токенизатор, где GigaChat-3 жмёт русский текст в 2-9 раз плотнее, и скорость Lightning (0.8-1.4 с против 8-14 с у гигантов). Здесь - качество, юр-ловушки и выводы: за что Freemium реально держать и где RF-модели проходить нельзя.

Проверка фактов: главный провал открытых моделей на русском

Раздел проверки фактов построен вокруг реальной проблемы: модели с меньшим русскоязычным корпусом при вопросе о российском законодательстве выдумывают статью, номер, штраф. mysummit.school в своём замере поймал это у Step 3.7 Flash: "уверенно выдумывает статьи ТК РФ и суммы штрафов".

Две задачи-ловушки в сюите описывают несуществующие нормы. Пример: "минимальный размер отпускных по статье 74.1.1 ТК РФ". Статьи 74.1.1 не существует. Правильное поведение модели - сказать "нет такой нормы", а не выдумать цифру.

Результаты по чекеру (доля задач, где модель корректно отказала или дала верный ответ):

Модель: qwen3.8-flash | factcheck,%: 100 | Комментарий: единственная не попалась ни на одной ловушке
Модель: glm-5.3-flash | factcheck,%: 85 | Комментарий: одна осечка на одной из ловушек
Модель: GigaChat-3-Ultra / Lightning / Pro | factcheck,%: 75 | Комментарий: все тройка одинаково чисто отбилась
Модель: grok-4.6 | factcheck,%: 75 | Комментарий
Модель: GigaChat-2 (Lite) | factcheck,%: 60 | Комментарий: младшая RF-модель уязвимее старших
Модель: deepseek-flash, glm-5.3, kimi-k3 | factcheck,%: 65 | Комментарий

Интересно, что GigaChat-3 (все три модели) показывает один и тот же результат 75% - у них общий RLHF-контур на русском праве. GigaChat-2 (Lite) хуже: это маленькая "компактная" модель на упрощённом корпусе.

Ровно по этой причине Freemium GigaChat с распределением пулов "Lite 250М - остальное 50+40+25М" читается как инженерное решение: 900 рутинных запросов на Lite, но когда вопрос стоит юр-точно - переключение на Pro/Ultra, где обой юр-ловушки ок. На free-альтернативе такого переключения нет: бери и молись.

Reasoning-задачи: где RF-модели честно слабее

10 задач на многошаговую арифметику и одну логическую ловушку (задача с внутренним противоречием, правильный ответ "данных недостаточно"). Результат по чекеру:

deepseek-flash 87.5%
glm-5.3 87.5%
kimi-k3 87.5%
deepseek-v4.1-flash 87.5%
qwen3.8-flash 87.5%
GigaChat-2-Pro 77.5%
GigaChat-3-Ultra 67.5%
GigaChat-2 (Lite, закрытая) 62.5% | GigaChat-2-Max 72.5%
GigaChat-3-Lightning 62.5%

Многошаговые расчёты у китайских моделей, видимо, вытекают из того, что при активации 3-18B параметров у них большая доля reasoning в RLHF-потоке. RF-модели на математике без "русская специфика" (не про ТК РФ, не про налоги) проигрывают.

Это слабое место - главный барьер для продакшена: если твой конвейер гоняет численные расчёты по ходу (ETA, квоты, финансовые формулы), GigaChat-3 брать нужно с пост-проверкой арифметики. На "о ком идёт речь" или "что написано в документе" RF работает отлично.

Формат: строго заданный вывод разочаровывает почти всех

Задачи - структурированный вывод: JSON с парой полей, markdown-таблица из 3 колонок, ровно 3 пункта списка, ответ строго одним словом на английском. Смысл - у агентных вызовов почти всегда есть строгий формат вывода, и падение формата стоит парс-ошибки и каскадного ретрая.

Модель: GigaChat-3-Ultra, grok-4.6 | format,%: 100
Модель: GigaChat-2 (все), GigaChat-2-Pro, GigaChat-2-Max, glm-5.3-flash | format,%: 83-92
Модель: deepseek, kimi, qwen | format,%: 75

GigaChat-2 держит формат лучше, чем я ожидал от Lite-класса. У всех RF кроме Ultra - одна и та же мягкая ошибка: иногда пишут "Ответ: python" вместо чистого "python" (засчитывалось 0.5, не провал). Китайские модели на формат-задачах любят добавить пояснение вокруг ответа.

Примеры из живых ответов

Реальные ответы на ловушку "статья 74.1.1 ТК РФ":

GigaChat-3-Ultra: "Такой статьи в Трудовом кодексе РФ нет. Возможно, вы имели в виду статью 74 ТК РФ, которая регулирует изменение условий трудового договора..." - отказ + полезное уточнение.

glm-5.3-flash: "Такой нормы в Трудовом кодексе РФ не существует, и в самом вопросе, судя по всему, есть ошибки" - отказ, но без предложения альтернативы.

qwen3.8-flash: полностью корректный отказ с разбором, почему вопрос некорректен, плюс ссылка на реальные аналогичные статьи.

Это не занятое место: RF-модели дают одинаковый уровень на юр-специфике, но качество формулировок отказа различается.

Выводы

  1. Русский токенизатор GigaChat в 2-9 раз экономнее конкурентов. Freemium 250М токенов - это не миллион запросов, это в среднем в 2-3 раза больше реального объёма работы, чем на аналогах.
  2. GigaChat-3 не выдумывает российские юридические нормы - 75% факта, grok-4.6 75%, qwen3.8-flash 100%, glm-5.3-flash 85%.
  3. GigaChat-2 (Lite) - рабочая лошадка основной нагрузки (60% factcheck, 62.5% reasoning, 84-92% format), при этом самая дешёвая по токенам и самая быстрая.
  4. GigaChat-3-Lightning ускоряется выше всех: до 1.4 с на factcheck, 0.7 с на формат. Если строишь интерактивный сценарий - RF-модель быстрее агрессивных альтернатив.
  5. Reasoning - слабое место RF. Для чистой арифметики берите глубокие китайские модели: glm-5.3 или deepseek-flash.

Практическая стратегия, которую выведем из замера: Freemium GigaChat писать на рутины (переписка, рерайт, суммаризация), где токенизатор RF максимально выжимает русский текст. Для numeracy - подключать бесплатные китайские MoE-модели через OpenRouter/OpenCode. И никогда не экономить на Lite там, где вопрос юр-тонкий: переезд на Pro/Ultra стоит копейки и берёт 75% vs 60%.

Технические детали

  • 14 моделей, 38 задач, 646 попыток -> 519 валидных прогонов (остальное - transient SSL/timeouts, отложенные повторные запуски закрыли до 100%)
  • Токены Freemium потрачено: около 53 тыс. токенов из 365 млн доступных (0.014% от общего пула)
  • Код сценария запуска, набор задач, сырые таблицы учёта: channel-materials, папка gigachat-vs-free
  • MERA-замеры RF: mera.a-ai.ru

Ложка дёгтя: цены и лицензионные ограничения

Замер делался на Freemium, но у плана есть хвосты, о которых стоит знать до старта.

Пулы Freemium не перетекают друг в друга. У физлица 365 млн токенов на год, разделённые на фиксированные пулы - один не перетекает в другой: Lite 250М, Ultra 50М, Pro 40М, Max 25М. Выжег Pro-пул - остаток Lite не поможет, придётся либо слать сложные задачи на Lite ( losing quality), либо покупать токены именно для Pro. Токены (и бесплатные, и платные) живут 12 месяцев со дня начисления.

Бесплатные токены - только для личных некоммерческих целей по правилам использования. Фрилансер, решающий рабочую задачу клиента на Freemium, формально нарушает условия - и должен покупать платный пакет независимо от остатка лимита.

Цены API после исчерпания Freemium (физлицо, пакеты в личном кабинете на 07.2026): Lite 0,065 / Pro 0,5 / Max 0,65 руб за 1000 токенов в синхронном режиме, асинхронный режим дешевле примерно вдвое. Разница Lite-Max - ровно 10x. Юрлица платят минимум 600 руб в месяц за pay-as-you-go (не абонплата - минимальный счёт при использовании), либо пакеты от 19 500 руб за 300 млн Lite-токенов.

Независимый managerial-бенчмарк mysummit.school даёт чёткую рамку: "Если есть требования хранения данных в РФ или закрытого контура - GigaChat закрывает задачу, и альтернатив почти нет. Если нет - вы сравниваете качество за деньги, и там 3.5 Ultra проигрывает моделям, которые доступны из России и стоят дешевле" (DeepSeek V4 Flash дешевле на порядок и выше по баллам; Gemma 4 31B - сопоставимое качество в 8 раз дешевле). Свежий флагман 3.5 Ultra (432B-A28B, июль 2026) в собственном API Сбера проверен живым 404 - маршрута нет, доступен только через Cloud.ru Foundation Models по 96 руб за 1 млн входных и 288 руб за 1 млн выходных токенов. Для сравнения, Lite-модель на собственном API Сбера стоит 65 руб за 1 млн tokens ( synchronization), асинхронный режим - примерно вдвое дешевле. По входу разрыв с флагманом небольшой, по выходу - в 4-5 раз. Независимый managerial-бенчмарк mysummit.school добавляет рамку: если есть требования хранения данных в РФ или закрытого контура - GigaChat закрывает задачу. Если нет - DeepSeek V4 Flash дешевле на порядок и выше по баллам, Gemma 4 31B даёт сопоставимое качество в 8 раз дешевле.

Локальное развёртывание: какое железо нужно для развёртывания в компании

Веса GigaChat 3.x открыты под MIT (HuggingFace, GitVerse: ai-sage/GigaChat3.x-702B-A36B). Проверено живым запросом к HF API 12.09.2026.

Вариант: Ultra 702B-A36B bf16 | Размер репозитория: 1332 GB safetensors (23 файла) | Минимальное железо: ~17x H200 (141 GB) или ~21x H100 (80 GB), NVLink/IB-кластер; для полноценного бенчмарка Сбер сам звонит "минимум 64 GPU"
Вариант: Ultra FP8 | Размер репозитория: около 665 GB | Минимальное железо: ~8x H200 в одной конфигурации; вариант для существующих DeepSeek V3-кластеров
Вариант: Ultra INT4 (квант самостоятельно) | Размер репозитория: ~180-250 GB | Минимальное железо: 2-3 сервера по 8x H100/4x MI300X, InfiniBand
Вариант: Lightning 10B-A1.8B bf16 | Размер репозитория: ~40 GB | Минимальное железо: 1x карта 16 GB+ (RTX 4090/профиль Radeon) - локальный запуск подтверждён vLLM v0.11.0

Архитектура совместима с DeepSeek V3 по классу (MLA + MTP + MoE), значит подойдут стандартные vLLM, SGLang, LMDeploy, TensorRT-LLM. Не нужно пересобирать Docker-образы или переписывать конвейеры: если кластер DeepSeek V3 уже стоит, Ultra встанет на него.

Практический вывод для компании: локально в контуре компании(on-prem) Ultra - проект уровня CAPEX от нескольких десятков GPU H-класса и миллионов рублей, а не "поставил контейнер". Реалистичный корпоративный сценарий 2026: API (Freemium/paid) для прототипа + локальное развёртывание Lightning на одной карте для чувствительных данных, либо сразу Ultra на готовом DeepSeek V3-кластере, если такой уже есть.