Опубликовано
Бартовски за неделю упаковал девять моделей. Две уже стали хитами
Автор: Гусев Николай [портфолио]
Темы: local-models, gguf, llama-cpp

Бартовски не придумывает модели. Он берёт открытые веса, проверяет их в llama.cpp и выпускает квантованные версии для локального запуска. Поэтому его витрина показывает две разные вещи: кто выпустил архитектуру и кто успел сделать удобный GGUF.
Снимок сделан 25 сентября 2026 года по данным еженедельного сканирования. За неделю в коллекциях появились девять новых упаковок. Две сразу собрали десятки тысяч загрузок. Остальные интересны специализацией или размером, но для домашнего стенда они подходят хуже.
Загрузки на Hugging Face показывают интерес. Они не показывают качество. Об этом стоит сказать сразу, иначе карточка с миллионом скачиваний превращается в аргумент в пользу любой архитектуры.

Сначала о главном
MiMo-V2.6-Distill-Qwen-9B-GGUF получила 44 427 загрузок за семь дней. У Altworld_Hemmingway-1-GGUF 26 094. Для сравнения, у остальных семи упаковок от нуля до 1 834.
Это хороший сигнал. Пользователи заметили MiMo и Hemingway, скачали файлы, попробовали запустить. Но это ещё не бенчмарк. Люди могут качать модель из-за размера, имени, картинки в карточке или потому, что она первой попалась в ленту рекомендаций.
Поэтому ниже я разделяю модели по тому, что с ними можно сделать, а не по числу загрузок.
Что добавилось в коллекции

MiMo-V2.6-Distill-Qwen-9B-GGUF
Автор исходной модели - Xiaomi MiMo. Упаковка Бартовски создана 21 сентября 2026 года. Q4_K_M занимает 5,84 ГБ. Для изображений нужен отдельный файл mmproj-F16.gguf.
Это компактная мультимодальная модель на базе Qwen3.5-9B-Base. Она работает с текстом и изображениями, поддерживает рассуждение, программирование и вызов инструментов через шаблон чата. На карточке исходной модели указаны такие результаты:
SWE-bench Verified: 61.1%
SWE-bench Pro: 44.6%
Terminal-Bench 2.1: 37.1%
Toolathlon Verified: 35.2%
Эти цифры сообщают авторы MiMo. Я не проверял их независимым запуском Бартовски. Для GGUF особенно важно проверить, насколько квант сохраняет поведение исходной модели.
Где это полезно:
- локальный кодовый агент с инструментами;
- анализ изображений вместе с текстом;
- RAG по документам с иллюстрациями;
- запуск на компьютере с 8 ГБ VRAM;
- черновики и переводы.
MiMo выглядит самым практичным кандидатом из девяти. Не потому, что карточка самая громкая. У неё понятный размер, понятный сценарий и достаточно широкая специализация для первого домашнего теста.
Карточка MiMo-V2.6-Distill-Qwen-9B-GGUF
Altworld_Hemmingway-1-GGUF
Модель выпущена Altworld. Q4_K_M занимает 17,44 ГБ. Это текстовая модель на 27 миллиардов параметров.
Hemingway заявлена для коротких бытовых и деловых сообщений, писем и повседневных текстов. В карточке есть MTP-слои, которые можно применять для ускоренного декодирования через llama.cpp.
В тестах авторов модель сравнивается на письмах арендодателю, коллегам и сервисам поддержки. Это тесты самих авторов на 80 запросах. Их нельзя выдавать за независимое сравнение с другими моделями.
Где это полезно:
- письма клиентам;
- ответы в поддержке;
- переписка с арендодателем или подрядчиком;
- редактирование канцелярских сообщений;
- черновики публикаций.
У модели есть ограничение, которое важнее размера файла. В карточке она описана как English-first. Русский не указан среди поддерживаемых языков. Для русскоязычного канала это означает отдельный тест. Название не превращает английскую модель в русскоязычную.
Карточка Altworld_Hemmingway-1-GGUF
LensVLM-9B-GGUF
LensVLM выпустила Apple. Упаковка создана 23 сентября 2026 года. Q4_K_M занимает 5,84 ГБ.
Это специализированная VLM для визуального текста. Модель получает страницу документа, сжимает её визуальное представление и использует результат для ответов на вопросы по документу. В исходном описании есть режимы сжатия в 5, 10 и 15 раз.
Это не универсальная модель для любых картинок и не полноценная замена OCR. Сначала модель помогает выбрать важную часть визуального документа, а уже потом с ней работают.
Где это полезно:
- длинные PDF с большим числом страниц;
- сканы и фотографии документов;
- поиск ответа по конкретной странице;
- RAG по визуальным документам;
- предварительный отбор страниц перед обычным чтением.
Для DevOps или QA это потенциально полезный отдельный этап обработки документа. Например, инженер получает большой пакет сканированных инструкций, а модель помогает выбрать страницы с нужным разделом. Таблицы, формулы и мелкий текст после этого всё равно нужно проверять.
OliviaRossi MiMo-Ornith-9B-AGSI-GGUF
OliviaRossi объединила MiMo-V2.6-Distill-Qwen-9B и Ornith-1.5-9B. В карточке указана модель размером около 10B. Q4_K_M занимает 5,98 ГБ.
MiMo сильнее в математических рассуждениях, программировании и длинных цепочках вывода. Ornith обучена работе с терминалом, Bash и автономному выполнению задач. AGSI сохраняет направления изменений весов при слиянии и пытается уменьшить потери от обычного усреднения.
Лицензия, указанная в карточке упаковки, Apache 2.0. Это не отменяет необходимость проверить условия исходной модели перед коммерческим использованием.
Где это полезно:
- системное администрирование через терминал;
- чтение логов и отладка;
- Bash-скрипты;
- программирование и использование инструментов;
- локальный агент на 8 ГБ VRAM.
Название Ornith здесь не объясняет само по себе качество. Слияние двух моделей может дать полезный специализированный профиль, а может оставить у такой смеси лучшие свойства только на бумаге. Нужен свой набор задач и сравнение с каждой исходной моделью.
Карточка MiMo-Ornith-9B-AGSI-GGUF
Специалисты и эксперименты
Ling-3.0-flash-VL-GGUF
InclusionAI выпустила мультимодальную MoE-модель. Всего в ней 124 миллиарда параметров, при обработке одного токена активны 5,5 миллиарда. Контекст заявлен до 256 тысяч токенов.
Q4_K_M разделён на два файла и занимает около 78,66 ГБ. Это серверная модель, а не загрузка на домашнюю видеокарту. Слово Flash здесь не отменяет требования к памяти.
Где она может быть полезна:
- длинные видеотрансляции и архивы;
- анализ интерфейсов веб-приложений;
- агенты, которые видят экран и выполняют действия;
- документы с графиками и сложной вёрсткой;
- большие мультимодальные контексты на сервере.
У модели 49 загрузок и 7 лайков за неделю. Это слишком маленькая выборка, чтобы судить о спросе. Но специализация понятна, а объём памяти сразу отсекает большую часть домашних пользователей.
Карточка Ling-3.0-flash-VL-GGUF
Swift-1.5-Qwen3.8-27b-GGUF
UkisAI выпустила Swift 1.5 на базе Qwen3.8-27B. Q4_K_M занимает 17,44 ГБ. В упаковке есть мультимодальный проектор.
Заявленная идея - сократить бесполезные рассуждения в длинных агентных и программных задачах. Авторы сообщают о 58,5% меньших токенах рассуждения, росте результата на 0,35% и ускорении в 1,95 раза. Это их измерения. Я не превращаю их в независимый результат.
Модель может пригодиться в таких сценариях:
- программирование;
- длинные циклы работы с терминалом;
- агентные задачи с большим числом шагов;
- анализ репозитория и журналов;
- экономия токенов при повторных вызовах.
На момент снимка у упаковки было 0 загрузок и 3 лайка. Это не проблема модели. Просто снимок сделан в день появления карточки. Для оценки Swift нужен отдельный замер на длинных задачах, где действительно видно расход reasoning-токенов.
Карточка Swift-1.5-Qwen3.8-27b-GGUF
JetBrains-Qwen3.8-3.6-27B-blend-GGUF
JetBrains выпустила линейную смесь двух 27B-моделей: Qwen3.6-27B и Qwen3.8-27B. В каждой половине примерно 50% параметров. Дополнительного обучения в карточке не указано.
Q4_K_M занимает 17,44 ГБ. Обработчик изображений и шаблон чата взяты из Qwen3.8-27B. Название blend здесь не означает отдельную архитектуру с новым способом обучения. Это смесь весов.
Где это полезно:
- локальное программирование;
- анализ изображений и документов;
- сложные инструкции с инструментами;
- исследование влияния смешивания двух моделей Qwen;
- сравнение поведения Qwen3.6 и Qwen3.8.
У упаковки 1 434 загрузки и 2 лайка. Карточка не показывает независимого сравнения blend с обеими исходными моделями. Поэтому это интересный архитектурный образец, но не рекомендация ставить его первым.
Карточка JetBrains-Qwen3.8-3.6-27B-blend-GGUF
Tev1-4B-experimental-GGUF
Together AI выпустила экспериментальную модель на базе Qwen3.5-4B. Q4_K_M занимает 2,80 ГБ.
Tev1 выбирает один вариант из списка. На вход подаются состояние системы, вопрос и от 2 до 24 вариантов ответа. На выход ожидается короткий ответ с выбором одной буквы. В карточке рекомендуют отключать рассуждение, ставить температуру 0 и ограничивать ответ восемью токенами.
Это специализированный классификатор решений. Универсальным чат-ботом его называть нельзя. Для маршрутизации обращения или выбора следующего шага агента такой маленький размер может быть плюсом. Для свободного диалога или финансовых решений он слишком узкий.
Внутренние тесты Together показывают 88% на основном наборе решений и 100% на синтетическом наборе переноса правил. Это заявления авторов на их наборах. Независимого теста нет.
Где модель может быть полезна:
- выбор следующего действия агентом;
- маршрутизация обращения;
- проверка правил по состоянию системы;
- классификация запросов;
- локальное принятие решений при небольшом списке вариантов.
Карточка Tev1-4B-experimental-GGUF
When2Think-ThinkOnly-1.5B-GGUF
junshim выпустил исследовательскую модель на базе DeepSeek-R1-Distill-Qwen-1.5B. Q4_K_M занимает всего 1,15 ГБ.
В отличие от обычной When2Think, версия ThinkOnly всегда использует явные рассуждения перед ответом. Авторы связывают такую схему с математикой, символьными системами, программированием и научными задачами.
Независимых результатов в карточке нет. Поэтому 797 загрузок пока говорят только об интересе к короткой модели. Качество рассуждений здесь надо проверять на задачах с проверяемым ответом.
Где её можно использовать:
- эксперименты с короткими моделями для рассуждения;
- исследование глубины размышления;
- прототипы математических и символьных проверок;
- локальный запуск на слабом компьютере;
- дообучение под собственные проверяемые задачи.
Карточка When2Think-ThinkOnly-1.5B-GGUF
Что брать на стенд
Первым я бы поставил MiMo-V2.6. Размер Q4_K_M позволяет обойтись компьютером с 8 ГБ VRAM, а мультимодальный режим даст больше сценариев, чем обычный текстовый чат. После него имеет смысл проверить LensVLM на реальном PDF со сканами или фотографиями страниц.
Hemmingway стоит тестировать только под конкретный языковой сценарий. Если задача - английские письма и короткие деловые сообщения, модель выглядит логично. Для русскоязычного текста сначала нужны несколько одинаковых примеров и ручная оценка результата.
MiMo-Ornith можно проверить как модель для терминала. Здесь важны правильность ответа и устойчивость к длинному логу, JSON-командам и сбоям инструмента. Swift и JetBrains Blend лучше оставить на второй круг: обе модели требуют больше памяти, а их специализация не настолько очевидна.
Проверять каждую упаковку можно по одной схеме:
- Скачать карточку и проверить лицензию исходной модели.
- Выбрать десять одинаковых задач из своей работы.
- Запустить одинаковый шаблон чата и одинаковый набор квантов.
- Записать время ответа, расход VRAM, ошибки формата и число исправлений.
- Сравнить правильность ответа и стоимость повторных попыток.
Этот список длиннее, чем открыть файл и посмотреть на его размер. Именно поэтому он и нужен: локальный запуск сам по себе ещё ничего не проверяет.
Инженерный вывод
За неделю Бартовски сделал квантованные версии девяти новых моделей. Две быстро набрали загрузки, ещё несколько имеют понятную специализацию, а часть требует сервера или относится к экспериментам.
GGUF снижает порог запуска. Он не превращает исходную архитектуру в лучшую модель и не подтверждает цифры авторов. Бартовски сделал работу удобной. Проверку качества он оставил тем, кто запускает эти файлы.
Для первого домашнего теста я бы взял MiMo-V2.6. Затем LensVLM, если есть реальный архив PDF. Hemingway имеет смысл проверять только под английский письменный сценарий. Остальные модели пока выглядят специализированными стендами для эксперимента.
