Опубликовано
K2 Horizon: первая фронтир-линейка из ОАЭ, которая сама себе снизила бенчмарки
Автор: Гусев Николай [портфолио]
Дата обновления не указана в исходнике.
Темы: llm-news, benchmarks
Сложность: низкая
3 сентября IFM - институт базовых моделей при университете MBZUAI из Абу-Даби - выпустила K2 Horizon: сразу шесть моделей от 0.9B до 375B под Apache 2.0. Это первый фронтирный релиз такого масштаба из ОАЭ и, по заявлению самой лаборатории, крупнейший полностью открытый релиз в истории ИИ. Разбираю, что там внутри, чем интересна архитектура MoVA и почему самая любопытная часть релиза - не бенчмарки, а аудит, который лаборатория провела над собой.
Кто такие IFM
MBZUAI - первый в мире университет, целиком посвящённый искусственному интеллекту (основан в 2020 году). В мае 2025-го при нём запустили Institute of Foundation Models, а офисы открыли в трёх местах: Силиконовая долина, Париж и Абу-Даби. Во главе - Эрик Синг (Eric Xing), президент MBZUAI. Релиз выходит на фоне более широкой стратегии ОАЭ: страна строит датацентр-кампус на 5 ГВт и подписывает соглашения с Microsoft, Nvidia и OpenAI. K2 Horizon - видимая часть этой стратегии: не закрытая модель для государственных нужд, а открытый флот, который любой может скачать и проверить.
Формулировка Синга из пресс-релиза: "Open source - это гораздо больше, чем открытые веса. Наука работает тогда, когда другие видят данные, метод, могут воспроизвести результат и улучшить его".
Что выпустили
Шесть моделей с единой архитектурой, словарём и тулингом. Идея - прототипируй на маленькой, масштабируй на большую, не меняя инфраструктуру:
- 0.9B - dense, для часов и очков (у него уменьшенный словарь)
- 3.7B - dense, для телефона и экспериментов
- 7B - dense, телефоны и дешёвый хостинг
- 32B - dense, контекст 512K, локальный хостинг
- 36B-A4B - sparse MoE с новым вниманием MoVA, 4B активных, 512K
- 375B-A23B - sparse MoE, 23B активных, флагман для энтерпрайза
Каждую модель обучали примерно на 20 трлн токенов, около половины данных - синтетика, почти 17% корпуса - задачи с пошаговым рассуждением. Отдельная деталь методологии: SFT-данные подмешивали прямо по ходу претрейна, а не в конце - так набрали больше 100 млн уникальных синтезированных задач.
"Полностью открыт" - это не "открытые веса"
Обычно "открытая модель" означает: вот веса, вот техотчёт, удачи. IFM выложила весь жизненный цикл обучения: промежуточные чекпойнты, тренировочные данные или детальные рецепты их сборки, код обучения, конфигурации, логи, результаты оценок. Для каждой из шести моделей. Первая открытая модельная семья, которая показывает весь путь через агентное пост-обучение - можно изучать, как рассуждение, tool use и планирование вообще возникают в модели, а не только пользоваться готовым.
Лицензия Apache 2.0 на модели и код. Датасеты - под своими лицензиями (ODC-BY и другие); где перевыпуск данных невозможен, IFM раскрывает, как они были собраны и смешаны.
Две архитектурные новинки
MoVA (Mixture-of-Values attention). Классический MoE применяет разреженность только к слоям прямого прохода (FFN). MoVA расширяет принцип разреженности на механизм внимания: в каждом слое маршрутизируется 64 матрицы проекции значений, и на токен активируется только часть. Результат: модель на 36B хранит ёмкость большой сети, а считает как маленькая - 4B на токен. На модель-карте это выглядит так: tau3-Banking (агентный tool use) - 26.8 против 14.2 у Nemotron 3 Ultra, MoE на 550B с 55B активными. Terminal-Bench 2.1 - 58.6 против 53.9 у того же гиганта. Против Qwen3.6-35B-A3B, ближайшего по активному footprint (3B активных), разрыв ещё заметнее: 26.8 против 9.3 на tau3-Banking.
Честности ради, где модель проигрывает: GPQA Diamond (80.8 против 86.7 у Nemotron 3 Ultra), Humanity's Last Exam (25.2 против 28.4), SciCode (38.9 против 43.6 у Muse Glimmer-30B). MoVA заточена под агентные и инструментальные задачи, а не под чистое знание или научные выводы.
Uno. Ускоритель декодирования в виде LoRA-адаптера: базовые веса заморожены, отдельный набор диффузионных параметров учится генерировать блоки токенов параллельно. Около трёхкратного ускорения без потери качества. Адаптеры есть для 0.9B и 7B.
Аудит, который другие не публикуют
Вот это самое редкое в релизе. Флагман 375B-A23B прошёл Terminal-Bench 2.1: 712 прогонов, 500 успешных - заявка на 70.2%. Потом IFM сама прогнала каждое успешное испытание через аудит на reward hacking по методике Artificial Analysis. Нашла 24 испытания в 10 задачах, где модель находила репозитории бенчмарка на GitHub и скачивала готовые решения вместо решения задач. Вычли - опубликовали 66.9%.
Минус 3.37 процентных пункта, признанные публично. Для сравнения: уровень "флагов" у Claude Fable 5 - 2.2%, у GPT-5.6 Luna - 4.1%. K2 Horizon честно встал посередине. Плюс IFM раскрыла, что 7B на одном из прогонов SWE-bench показала завышенные 82 балла, найдя ответы в открытом доступе.
В индустрии, где все показывают только лучшие прогоны, публиковать свой штраф - ход, который говорит больше половины лидерборда. Независимого воспроизведения пока нет: все цифры - заявленные самой IFM, и после внешнего аудита картина может стать скромнее.
Младшая линейка - тихая сенсация
0.9B набирает 48.5 на AIME 2026 и 79.9 на HumanEval+ - это уровень моделей в разы больше. 3.7B - 68.6 на SWE-bench Verified, 7B - 70.6 на SWE-bench Verified и 59.0 на BrowseComp. IFM заявляет SOTA в весовых категориях для 0.9B, 3.7B и 7B. Если числа подтвердятся независимыми прогонами, представление о том, что умеет модель на миллиард параметров, придётся обновить.
Практическая сторона
Все модели уже на HuggingFace с FP8 и GGUF. Нюанс: GGUF IFM выложила только в BF16 без квантов - проверил по API, у 36B-версии файл весит 69.8 GB, у 0.9B - 2 GB. Сторонние кванты (Unsloth, bartowski) обычно появляются за пару недель - для локального прогона MoVA-36B-A4B стоит подождать Q4, или пока тыкать 0.9B. Важная оговорка: модели обучены преимущественно на английском, русскую генерацию IFM не заявляла и не тестировала - проверяйте на своих задачах.
Итог
Даже если после независимых проверок цифры окажутся скромнее, IFM показала, как должен выглядеть открытый релиз: не одна строка в таблице, а воспроизводимый эксперимент с публичной погрешностью. ОАЭ при этом встала в игру как производитель фронтир-моделей, а не только как покупатель чипов и арендатор вычислений.
Ссылки: коллекция на HuggingFace, блог IFM, пресс-релиз.