Тема: benchmarks
Qwen-Image-2.1 на RTX 4060: текст в кадре, прозрачность и референсы вместо IP-Adapter
Alibaba выложила 7B-модель с нативной прозрачностью и до 10 референсов. Проверил на 8 ГБ VRAM за вечер: текст пишет верно (int4 - уже нет), стикер с альфа-каналом без вырезания, правка за 5.
Четыре эвала для модели решений: Jev в бою
Jev не пишет текст - возвращает типизированные вердикты с вероятностями.…
Любовь - это русские придумали, чтобы денег не платить, или как добить бесплатных Бертов до платного Jev
В прошлой части ответ был "плати за калибровку". Спойлер: не обязательно.
Bonsai 2 27B в пайплайне: история одного разочарования
Подключил тернарную 27B к Hermes-агенту и ждал ответа шесть минут - до первого токена. Разобрал по цифрам, почему так: ход агента весит 15-20к токенов, а prefill на 8 ГБ идёт 28 tok/s.
Bonsai 2 27B на RTX 4060: замер скорости, качества и контекста
PrismML выпустила Bonsai 2 - тернарную версию Qwen3.
Очень хороший прогресс для локальных моделей.
PrismML выпустила Bonsai 2 27B на базе Qwen3.
38 задач, 8 русских моделей: YandexGPT и GigaChat в одном замере
Я сравнил два русских API, доступных физлицу без корпоративной карты: GigaChat Freemium с 365 млн токенов в год и Yandex Cloud со стартовым грантом 4000 руб.…
Живой замер API: 38 задач, 14 моделей и одна несуществующая статья ТК
Прогнал 608 запросов через 14 моделей: GigaChat Freemium против китайских open-моделей. Русский токенизатор GigaChat-3 жмёт промпт в 3 раза плотнее qwen и в 3 раза плотнее kimi, Lightning отвечает за 1.
Diff недели: агентные тесты новых моделей на RTX 4060
Прогнал четыре новые модели из коллекции GGUF по той же методике, что и первую десятку: LFM2.
Русский токенизатор GigaChat против open-моделей: замер на 519 живых запросах
Все измерения выполнялись 12 сентября 2026 через реальные API: GigaChat PERS Freemium (6 моделей) и OpenCode Go подписка (8 моделей).…
State и поиск: от замера до пул-реквеста в Hermes Agent
Замер на живом архиве показал: агент хранит рассуждения, но ни один поиск их не видит. Предлагаю апстриму Hermes Agent опциональный охват session_search по полю reasoning, без миграции схемы и переиндексации.
State вместо истории: как малая модель с окном 32k тянет многоходовый чат
Проверил на своей 4060 три механики длинных сессий: классический ReAct со сквозным транскриптом, SKILL.
125B на одной RTX 4090: AirLLM принес к костру модель весом 360 ГБ
Habr 1079902 о запуске Qwen3.
ИИ - это не только кодописание. Часть 1: выбирать модель по задаче, а не по HumanEval
Закон об ИИ перевёл выбор модели из гонки бенчмарков в инженерную задачу: класс задачи, контур данных, локализация. Разбор Alice AI-T5-35B-A0.
Major release от нашей небольшой лабы. Поддержка спекулятивного декодинга в [нашем инференс движке](https://github.com/trymirai/uzu).
Для начала Qwen3.
Десять локальных моделей на RTX 4060: кто годится в агенты
Сложность: средняя…
K2 Horizon: первая фронтир-линейка из ОАЭ, которая сама себе снизила бенчмарки
3 сентября IFM - институт базовых моделей при университете MBZUAI из Абу-Даби - выпустила K2 Horizon: сразу шесть моделей от 0.
Диспетчер за полтора гигабайта: локальный оркестратор для AI-агента на MiniCPM5-2B
Платные лимиты горели на рутине, бесплатные простаивали, а выбор модели каждый раз был ручным.…
Комикс по ТЗ на 8 GB VRAM: три попытки и найденный метод
Задача "нарисуй комикс про Незнайку на Венере" на одной игровой карте: наивный конвейер из локальных малышей, ручной сценарий с промпт-ядром и канонический портрет с нативным редактированием.…
Бонус: колибри кормит кита - 744B локально на 16-24 GB VRAM
Проект colibri запускает фронт-модели 2026 года (GLM-5.
Бенчмарки врут красиво: 6 локальных моделей на выходные под 8 GB VRAM
Знакомая картина: выходит флагман, пресс-релиз пишет "на 3 пункта лучше конкурента", твиттер разносит скриншоты таблиц, и все уже "поняли", что новая модель вдвое умнее.
26B на игровой видеокарте: тест FreeToken
Хочется локальную модель класса 26B+, а в видеокарте 8 ГБ VRAM - плотная модель не влезает физически.…
Домашний Perplexity, часть 2: кто думает над выдачей
В первой части ассистент научился доставать факты из веба. Во второй - выбирать локальную модель для мышления над выдачей: пять моделей на грязном контексте, ловушка дат, два режима.
Контекст 900 тысяч токенов и вспомогательные модели: настраиваем Codex и Hermes Agent
Подписчик заметил, что контекст codex api вырос с 270к до 900к без единого changelog - и это не глюк: у gpt-5.
Vision в API за копейки: DeepSeek V4-Flash-Vision-Exp и локальный стек вместо облака
DeepSeek прикрутила зрение к дешёвой V4 Flash и обещает почти Opus 4.
"Как собрать свой домашний Perplexity на нулевом бюджете"
Perplexity удобен, но каждая работа в нём уходит на чужой сервер.…
Видит ли ассистент то, что видите вы?
Вы думаете, зачем здесь эти картинки? А вот сейчас и расскажу в статье.
book2rag: как загнать книги из Telegram в RAG
Пайплайн из пяти шагов — Telethon → pdftotext → чанкинг → DCD → ChromaDB. Превращает любой Telegram-канал с книгами в поисковую RAG-коллекцию.
pxpipe: как сократить токены Claude Code в 2-3 раза, рендеря контекст в изображения
Локальный прокси переводит тяжёлые части запроса в PNG, экономя 38-70% токенов на плотном контенте. Fable 5 читает рендеры 100/100, у Opus 4.
DCD: Domain–Collection–Document ↗️
Выпустили статью на arXiv, в которой представили DCD Design — архитектурный подход к организации пространства знаний и обработке запросов в RAG-системах.
Ponytail: ленивый сеньор-дев для AI-агентов
GitHub-проект DietrichGebert/ponytail — набор правил для AI-агентов, который заставляет думать перед тем как писать. 80-94% меньше кода по бенчмаркам.
Я попробовал разные варианты построения RAG и вот к чему пришел
Два RAG, два сервера, два подхода. Каждый оказался сильнее в чём-то своём.
Вот одна из причин почему я так заморачиваюсь с призм анализом, точными rag, гвардрейлами, clarity protocol, изучаю бенчмарки pii и прочие скучные вещи, а не пишу "клод сделай мне CRM чОткую"
KPMG отозвал отчет об ИИ. Не потому что ИИ оказался плох.
21 тип персональных данных: как открытый бенчмарк PII меняет правила игры для AI-ассистентов
red_mad_robot выложили открытый бенчмарк детекции PII на русском — 21 тип данных от ФИО до военного билета. Разбираю, почему это важно для AI-ассистентов: от guardrails до ФЗ-152 и DPA.
Talos V2: FPGA, микротрансформер и российское железо
Два студента собрали трансформер на ПЛИС за $150. Не софт, скомпилированный под FPGA, а чистый RTL — каждый слой нейросети как цифровая схема.