Тема: local-models
Qwen-Image-2.1 на RTX 4060: текст в кадре, прозрачность и референсы вместо IP-Adapter
Alibaba выложила 7B-модель с нативной прозрачностью и до 10 референсов. Проверил на 8 ГБ VRAM за вечер: текст пишет верно (int4 - уже нет), стикер с альфа-каналом без вырезания, правка за 5.
Четыре эвала для модели решений: Jev в бою
Jev не пишет текст - возвращает типизированные вердикты с вероятностями.…
Любовь - это русские придумали, чтобы денег не платить: добиваем бесплатных Бертов до платного Jev
В прошлой части laya уступала Jev в калибровке, и ответ был "плати за то, что сделали за тебя". Спойлер: не обязательно.
Любовь - это русские придумали, чтобы денег не платить, или как добить бесплатных Бертов до платного Jev
В прошлой части ответ был "плати за калибровку". Спойлер: не обязательно.
Bonsai 2 27B в пайплайне: история одного разочарования
Подключил тернарную 27B к Hermes-агенту и ждал ответа шесть минут - до первого токена. Разобрал по цифрам, почему так: ход агента весит 15-20к токенов, а prefill на 8 ГБ идёт 28 tok/s.
Bonsai 2 27B на RTX 4060: замер скорости, качества и контекста
PrismML выпустила Bonsai 2 - тернарную версию Qwen3.
Я тут, короче, помогаю одним активистам-экологам. Им нужно по фотографии хвоста понимать, какого именно кита они встретили. Не получить бесценный ответ «на снимке кит», а отличить Стаса от Петра и связать новую встречу с конкретной особью. Для начала у меня было шесть фотографий — не шесть тысяч и не шесть на каждого кита, а вообще шесть.
И я прямо представил, как красиво эту задачу можно продать. Сначала объясняем экологам, что без репрезентативного датасета ничего не получится, поэтому следующие два года они будут фотографировать китов.
Diff недели: агентные тесты новых моделей на RTX 4060
Прогнал четыре новые модели из коллекции GGUF по той же методике, что и первую десятку: LFM2.
State и поиск: от замера до пул-реквеста в Hermes Agent
Замер на живом архиве показал: агент хранит рассуждения, но ни один поиск их не видит. Предлагаю апстриму Hermes Agent опциональный охват session_search по полю reasoning, без миграции схемы и переиндексации.
State вместо истории: как малая модель с окном 32k тянет многоходовый чат
Проверил на своей 4060 три механики длинных сессий: классический ReAct со сквозным транскриптом, SKILL.
125B на одной RTX 4090: AirLLM принес к костру модель весом 360 ГБ
Habr 1079902 о запуске Qwen3.
Что реально качают из коллекции Bartowski
Что реально качают из коллекции Bartowski GGUF-квантов и что это значит для локального запуска…
ИИ - это не только кодописание. Часть 1: выбирать модель по задаче, а не по HumanEval
Закон об ИИ перевёл выбор модели из гонки бенчмарков в инженерную задачу: класс задачи, контур данных, локализация. Разбор Alice AI-T5-35B-A0.
Major release от нашей небольшой лабы. Поддержка спекулятивного декодинга в [нашем инференс движке](https://github.com/trymirai/uzu).
Для начала Qwen3.
Десять локальных моделей на RTX 4060: кто годится в агенты
Сложность: средняя…
Локальные LLM на Android: что и зачем реально можно гонять на телефоне
В прошлой статье я разбирал K2 Horizon - флот открытых моделей из ОАЭ с аудитом на reward hacking, который лаборатория провела над собой. Тогда я зацепился за младшую модель линейки: 0.
Модель в кармане как архивариус: мелкие LLM для порядка в телефоне
У тебя в телефоне есть маленькая модель (1-4B, как я разбирал раньше - она влезает в любой Android с 6 GB RAM), и есть телефон, в котором за годы жизни накопился хаос: фотографии по трём галереям, кни…
Библия попаданца: влезет ли вся наука в телефон
Мы с женой вчера обсудили классический сценарий "попаданца": если вдруг в прошлое, то электричество я худо-бедно добуду, а вот с остальным - химия, медицина, точные технологии - будет сложнее.…
Диспетчер за полтора гигабайта: локальный оркестратор для AI-агента на MiniCPM5-2B
Платные лимиты горели на рутине, бесплатные простаивали, а выбор модели каждый раз был ручным.…
Нейросети пришли в игры без зрения: как моды превращают CK3 в настолку с живым мастером
Мне прислали пост моего друга Александра Погольского из ВК. Прочитал, проверил по первоисточникам и понял, что тема интереснее, чем кажется из поста.
Комикс по ТЗ на 8 GB VRAM: три попытки и найденный метод
Задача "нарисуй комикс про Незнайку на Венере" на одной игровой карте: наивный конвейер из локальных малышей, ручной сценарий с промпт-ядром и канонический портрет с нативным редактированием.…
Бонус: колибри кормит кита - 744B локально на 16-24 GB VRAM
Проект colibri запускает фронт-модели 2026 года (GLM-5.
Бенчмарки врут красиво: 6 локальных моделей на выходные под 8 GB VRAM
Знакомая картина: выходит флагман, пресс-релиз пишет "на 3 пункта лучше конкурента", твиттер разносит скриншоты таблиц, и все уже "поняли", что новая модель вдвое умнее.
26B на игровой видеокарте: тест FreeToken
Хочется локальную модель класса 26B+, а в видеокарте 8 ГБ VRAM - плотная модель не влезает физически.…
Домашний Perplexity, часть 2: кто думает над выдачей
В первой части ассистент научился доставать факты из веба. Во второй - выбирать локальную модель для мышления над выдачей: пять моделей на грязном контексте, ловушка дат, два режима.
Контекст 900 тысяч токенов и вспомогательные модели: настраиваем Codex и Hermes Agent
Подписчик заметил, что контекст codex api вырос с 270к до 900к без единого changelog - и это не глюк: у gpt-5.
Vision в API за копейки: DeepSeek V4-Flash-Vision-Exp и локальный стек вместо облака
DeepSeek прикрутила зрение к дешёвой V4 Flash и обещает почти Opus 4.
Локальное зрение для Hermes Agent в закрытом контуре
Hermes Agent может работать с текстом, командами и данными, но для полноценного личного ассистента этого мало.
Видит ли ассистент то, что видите вы?
Вы думаете, зачем здесь эти картинки? А вот сейчас и расскажу в статье.
book2rag: как загнать книги из Telegram в RAG
Пайплайн из пяти шагов — Telethon → pdftotext → чанкинг → DCD → ChromaDB. Превращает любой Telegram-канал с книгами в поисковую RAG-коллекцию.
DCD: Domain–Collection–Document ↗️
Выпустили статью на arXiv, в которой представили DCD Design — архитектурный подход к организации пространства знаний и обработке запросов в RAG-системах.
Я попробовал разные варианты построения RAG и вот к чему пришел
Два RAG, два сервера, два подхода. Каждый оказался сильнее в чём-то своём.
Talos V2: FPGA, микротрансформер и российское железо
Два студента собрали трансформер на ПЛИС за $150. Не софт, скомпилированный под FPGA, а чистый RTL — каждый слой нейросети как цифровая схема.