Опубликовано
38 задач, 8 русских моделей: YandexGPT и GigaChat в одном замере
Автор: Гусев Николай [портфолио]
Дата обновления не указана в исходнике.
Темы: yandexgpt, gigachat, benchmarks
Я сравнил два русских API, доступных физлицу без корпоративной карты: GigaChat Freemium с 365 млн токенов в год и Yandex Cloud со стартовым грантом 4000 руб. Это не битва "кто лучше", а замер двух русских токенизаторов и двух юридических корпусов. Иногда именно такие детали больнее всего бьют по самоуверенному промпту.
Контекст и метод
Прогнал 38 задач в пяти категориях: factcheck, reasoning, writing, format и tokenize.
У Яндекса участвовали YandexGPT-5-Lite и YandexGPT-5.1-Pro через llm.api.cloud.yandex.net. У GigaChat - шесть моделей из предыдущего замера. Все 76 запусков Яндекса завершились со статусом ALTERNATIVE_STATUS_FINAL, без единой ошибки.
Проверки: factcheck/refuse, reasoning/numeric и format/exact_json. Чекер засчитывает частичные ответы как 0,5, поэтому дальше встречаются дробные баллы - это не опечатки.
Токенизация: Яндекс плотнее GigaChat-3
На пяти задачах Яндекс укладывал промпты в 42-43 токена в среднем, GigaChat-3 - в 47. Я сначала хотел торжественно объявить победителя, потом вспомнил, что это сравнение токенизаторов, а не олимпиада.
Задача Yandex 5.1-Pro Yandex Lite GigaChat-3
Z01 18 19 23
Z02 51 52 55
Z03 40 41 43
Z04 57 58 60
Z05 44 45 53
Z01 просит одним предложением объяснить, что такое sunglasses. Z02-Z05 - хозяйственная переписка, техдок и другие задачи из bench_tasks.json. У тройки GigaChat-3 токенизатор общий: Lightning, Pro и Ultra выдают токен в токен одни и те же 23/55/43/60/53.
Задержка: 1,33 с у 5.1-Pro
YandexGPT-5.1-Pro с 1,33 с оказался быстрее всех GigaChat, кроме Lightning с 1,16 с. GigaChat-3-Ultra с 5,60 с - самая медленная модель замера.
Модель Средняя задержка, с
YandexGPT-5-Lite 1.70
YandexGPT-5.1-Pro 1.33
GigaChat-2 1.69
GigaChat-2-Pro 2.73
GigaChat-2-Max 3.41
GigaChat-3-Lightning 1.16
GigaChat-3-Pro 2.01
GigaChat-3-Ultra 5.60
Ловушка 74.1.1: четверо GigaChat выдумали норму
F01 спрашивала о статье 74.1.1 ТК РФ, которой не существует. Тут проявилась главная находка замера: юридический корпус Яндекса надёжен у обеих моделей, а у GigaChat подвели даже старшие версии.
Обе яндексовские модели отказались корректно:
"В статье 74.1.1 ТК РФ информация о минимальных размерах отпускных денежных компенсаций для госслужащего, переведённого дистанционно, не содержится."
"К сожалению, у меня нет информации о статье 74.1.1 ТК РФ и минимальном размере отпускных денежных компенсаций для госслужащего, переведённого на дистанционную работу."
А GigaChat-2, GigaChat-2-Pro, GigaChat-2-Max и GigaChat-3-Lightning уверенно выдали несуществующие нормы:
"Минимальный размер денежной компенсации ... составляет не менее трехкратного размера среднего дневного заработка..."
"Статья 74.1.1 Трудового кодекса Российской Федерации устанавливает гарантии и компенсации..."
"Согласно статье 74.1.1 Трудового кодекса РФ ... составляет не менее двух третей..."
GigaChat-3-Pro отказался корректно:
"В Трудовом кодексе РФ статья 74.1.1 отсутствует..."
GigaChat-3-Ultra вместо ответа начал анализировать структуру ТК РФ и законодательство о государственной службе.
Итого по ловушке: шесть GigaChat - четыре выдумали норму, один отказался, один ушёл в рассуждения. Два Яндекс - ноль выдумок.
Качество: что говорит автоматика
Модель Factcheck Reasoning Format
YandexGPT-5-Lite 7.5/10 7.25/10 5.5/6
YandexGPT-5.1-Pro 8/10 7.75/10 6/6
GigaChat-2 6/10 6.25/10 5.5/6
GigaChat-2-Pro 6.5/10 7.75/10 5.5/6
GigaChat-2-Max 6/10 7.25/10 5.5/6
GigaChat-3-Lightning 7.5/10 6.25/10 5/6
GigaChat-3-Pro 7.5/10 6.25/10 5/6
GigaChat-3-Ultra 7.5/10 6.75/10 6/6
Три оговорки к таблице, без которых она врёт.
Первая: авто-чекер не засчитал отказ YandexGPT-5-Lite по F01 - в списке его маркеров нет формулировки "не содержится", хотя отказ корректный. Вручную это зачёт, фактический factcheck Lite - 8,5/10.
Вторая: R01 (заявки в рассрочку) со спорным эталоном - сам эталонный ответ арифметически спорен, а Яндекс и GigaChat-3-Ultra посчитали по 60% от обеих заявок и верно. Эту задачу ошибкой Яндекса я не считаю.
Третья: R09 - чистая арифметика. Эталон 1579, YandexGPT-5-Lite выдал 1564, Pro - 1512. Рядом обе модели написали верные формулы и ошиблись в сложении.
При ручной проверке reasoning у обеих моделей Яндекса - 6/10: ошибки в R03 (ответ числом вместо "данных недостаточно"), R04 (противоречие найдено не сразу), R05 (расчёт без данных) и R09.
Формат: JSON умеют все, арифметику внутри - почти никто
Шесть задач на строгий вывод. И тут главный подвох замера: JSON валидный у всех восьми моделей, а вот число внутри поля result - нет.
T01 просила JSON с полем result: 7 в кубе минус 40. Правильный ответ 303.
Модель result Что модель написала рядом
YandexGPT-5.1-Pro 303 верно
YandexGPT-5-Lite 343 в reason: "получаем 303"
GigaChat-2 33 в reason: "даёт результат 303"
GigaChat-2-Pro 9 "343 - 40 = 9"
GigaChat-2-Max 309 "343 - 40 = 309"
GigaChat-3-Lightning 293 "343 - 40 = 293"
GigaChat-3-Pro -3 "получаем 303; однако..."
GigaChat-3-Ultra 303 верно
Только YandexGPT-5.1-Pro и GigaChat-3-Ultra прошли все шесть задач формата. YandexGPT-5-Lite обиднее всех: в поле reason у него честно написано "получаем 303", а в result стоит 343. Модель знает ответ и записывает не его.
Для агентных пайплайнов это главный практический вывод замера: валидатор схемы не спасёт, если модель ошибается в арифметике внутри поля. JSON пройдёт проверку, а число уедет дальше по конвейеру.
Ложка дёгтя: цены
У GigaChat Freemium 365 млн бесплатных токенов в год: Lite 250 млн, Pro 40 млн, Max 25 млн, Ultra 50 млн. Дальше пакеты: Lite 20 млн за 1300 руб, это 0,065 руб за 1000 токенов; Pro 3 млн за 1500 руб, это 0,5 руб; Max 3 млн за 1950 руб, это 0,65 руб.
У Яндекса стартовый грант 4000 руб физлицам. YandexGPT Lite - 0,2 руб за 1000 токенов, входящие и исходящие одинаково. Pro 5.1 - 0,8 руб. Прошлое поколение Pro 5 стоило 1,2 руб: новый флагман не только быстрее, но и в полтора раза дешевле. Асинхронный режим вдвое дешевле синхронного: Lite 0,1 руб, Pro 5.1 - 0,41 руб за 1000 токенов.
Цены проверены на 15 сентября 2026: прайс AI Studio, тарифы GigaChat для физлиц, стартовый грант Yandex Cloud.
Материалы и замеры
Харнессы, сырые результаты и текст статьи - в открытом репозитории: GitHub | GitFlic. Внутри bench_tasks.json с 38 задачами, раннеры для обоих API и JSON со всеми прогонами - можно пересчитать любую таблицу из этой статьи самому.
Первая часть замера - Живой замер API: 38 задач, 14 моделей и одна несуществующая статья ТК: те же задачи против открытых моделей, там же полный разбор ловушки 74.1.1 у восьми зарубежных и открытых участников.
FAQ: что брать под задачу
Если планируешь X Бери Y В замере Z
Нужна минимальная задержка GigaChat-3-Lightning 1.16 с
Нужна быстрая модель Яндекса YandexGPT-5.1-Pro 1.33 с
Нужна плотная токенизация промптов YandexGPT-5.1-Pro 42 токена в среднем на Z01-Z05
Нужна бесплатная квота на год GigaChat Freemium 365 млн токенов в год
Нужен грант для старта в Яндексе Yandex Cloud 4000 руб физлицам
Есть ловушки с несуществующими нормами YandexGPT или GigaChat-3-Pro отказ по 74.1.1 ТК РФ
Нужен JSON с арифметикой внутри YandexGPT-5.1-Pro, GigaChat-3-Ultra единственные 6/6 по формату
Нужны задачи на рассуждение YandexGPT-5.1-Pro 7.75/10 по авто-чекеру