Тема: llm-news
Четыре эвала для модели решений: Jev в бою
Jev не пишет текст - возвращает типизированные вердикты с вероятностями.…
Очень хороший прогресс для локальных моделей.
PrismML выпустила Bonsai 2 27B на базе Qwen3.
Шесть кейсов OpenAI и почему они не новость
OpenAI 16.09.2026 собрала в одном framework шесть недавних кейсов misalignment и правила их публичного раскрытия. Это не сообщение о том, что ИИ вдруг научился обманывать.
Major release от нашей небольшой лабы. Поддержка спекулятивного декодинга в [нашем инференс движке](https://github.com/trymirai/uzu).
Для начала Qwen3.
K2 Horizon: первая фронтир-линейка из ОАЭ, которая сама себе снизила бенчмарки
3 сентября IFM - институт базовых моделей при университете MBZUAI из Абу-Даби - выпустила K2 Horizon: сразу шесть моделей от 0.
DCD: Domain–Collection–Document ↗️
Выпустили статью на arXiv, в которой представили DCD Design — архитектурный подход к организации пространства знаний и обработке запросов в RAG-системах.
Вот одна из причин почему я так заморачиваюсь с призм анализом, точными rag, гвардрейлами, clarity protocol, изучаю бенчмарки pii и прочие скучные вещи, а не пишу "клод сделай мне CRM чОткую"
KPMG отозвал отчет об ИИ. Не потому что ИИ оказался плох.
Больше контекста - хуже результат: почему AI-агенты деградируют на длинных сессиях и при чём тут CoT
После первой статьи про Cursor и компактинг развернулась жаркая дискуссия. Я решил собрать всю подноготную: исследования, цифры, механизмы.
Парадокс AI-агентов: 5 этапов для джуна и «погнали в прод» для чёрного ящика
Парадокс AI-агентов: 5 этапов для джуна и «погнали в прод» для чёрного ящика Сложность: продвинутый