← Лендинг Hermes Agent

Опубликовано

Как разбираться в ответах ИИ: 29 скилов на четыре ступени объяснения

Автор: Гусев Николай [портфолио]

Обновлено

Темы: hermes, teachme, skills

Сложность: средняя

Увидел новость про Карпатого от 2 октября, где он разбирал, как заставить модель объяснять понятнее. А потом, пока писал вторую часть разбора моделей, попросил пару примеров из математики разложить по шагам, чтобы понять, в каком месте сыпется производительность. И понял, что мне это нужно каждый день, а не два раза в месяц.

Так и собрал в одном месте все скилы, которые помогают понять материал для себя: 29 штук на четыре ступени, от короткого текста до объясняющего ролика и курса с практикумом.

Что такое teachme

Это не скилл про какой-то предмет. Это вход, который решает одну задачу: в каком формате объяснять дальше.

Многие ответы от моделей верные и при этом бесполезные. Не потому что модель ошиблась, а потому что формат не тот. Текст про устройство протокола требует от читателя держать структуру в голове, и он её не держит. Схема показывает то же самое структурой, а не словами. Ролик добавляет движение.

Задача teachme не ответить, а довести до понимания. Формат подбирается по тому, что именно не сработало: "текстом не понято" значит переходим на схему, "схема не понята, нужна динамика" значит нужен ролик. И начинаем с самой дешёвой ступени, которая может сработать.

Из teachme ничего не вынимается. Все скилы, которые он зовёт, продолжают работать по своим триггерам. Зонтичный только решает, в какой из них пойти.

Лестница форматов

СтупеньКогда подходитЧто зовём
Текстмысль укладывается в абзацasd-ste100, humanizer-ru, dont-paste-the-ai, pstack-teach
Схеманужен состав, поток или сравнениеeli5, docs-canvas, case-map-html, claude-design, system-designing
Видеонужно движение во времени: процесс, математика, алгоритмexplainer-video-3b1b, faceless-explainer, hyperframes, motion-graphics
Курспонимание нужно системно и с практикойcourse-program-design, teaching-create-learning-path, course-authoring

Видео стоит третьим не по порядку важности. Оно самое дорогое по времени: ролик собирается почти один в один со временем рендера, минута анимации это минута сборки. В него лезут, когда ступени выше не сработали.

Правило дешёвого первого шага

Главное, что стоит понять до применения: начинать с наименьшей ступени, которая может сработать.

Схема собирается за один вызов, минута. Ролик - это сценарий, отрисовка, склейка и озвучка, и работает только та мысль, которая уже понятна словами. Видео не лечит непонятую мысль, оно её озвучивает.

Отсюда следствие: если идея не рисуется картинкой, сперва её надо упростить, и только потом думать про ролик.

Ступень 1: текст, который нельзя перечитать дважды

У модели есть привычка писать в одно предложение несколько мыслей, а в одно слово - несколько значений. На инструкции это читается как "используй срок службы до истечения", и непонятно, тот это срок или тот, что истекает.

Авиамеханики с этим сталкиваются на земле, и не из-за перевода. Инструкция самолёта читается неродным английским человеком, у которого нет автора, чтобы позвонить и уточнить. Отраслевой выход - ASD-STE100: словарь около 900 слов, не больше 20 слов на инструкцию, одна мысль на предложение. Смысл в том, что у каждого слова одно значение, а не в том, что текст становится беднее.

Осторожно с модальностью. "Возможно, сбой произошёл из-за таймаута" и "сбой произошёл из-за таймаута" - это разные утверждения. Уверенность автора это содержание, и выбрасывать её вместе с канцеляритом нельзя.

Словаря в открытом доступе нет, ASD прямо запрещает его перепубликацию. Поэтому готовые скилы берут структурные правила, а лексические оставляют как направление.

С русским текстом та же история, но словарь другой. В арсенал лежит humanizer-ru: он ловит канцелярит, тяжёлые конструкции и штампы, проверяет тире и ёлочки.

Ступень 2: схема, если текст прыгает между шагами

Объём текста тут ни при чём. Четыре абзаца это меньше страницы, и терять в них нечего. Разница в том, что текст вынужден описывать состав и порядок словами, и читателю приходится собирать это самому.

Проверял на живой схеме: длинный список полей в три колонки ломался на узком экране. Тот же список в сетке с явными колонками и отступами читался за раз. Ни один скилл не проверял вёрстку - смотрел сам, в браузере, с вопросом про переполнение.

Ступень 3: видео, когда время не помещается в строку

Дальше нужно движение: процесс, у которого есть начало и конец, или математика, где формула не показывает, что происходит с ней при сдвиге.

Движок - Manim, код описывает сцену кадрами. Правка в цифре или в формуле делается в одной строке файла, дальше перерисовывается весь ролик. Никаких кликов по монтажной шкале в редакторе и повторной отрисовки кадра.

Проверял на чужой теме, на концепции LLM Wiki: записал, что вместо поиска по кускам в момент вопроса агент встраивает источник в общую базу, где ссылки уже расставлены и противоречия помечены, и собрал из этого ролик на двадцать пять секунд из шести сцен. Ролик и исходный код лежат в материалах к статье.

Отдельно про проверку. Exit code рендера не доказывает, что кадр правильный: в моём прогоне сцена сортировки давала неверный порядок при зелёном рендере, а заголовок в двух сценах уезжал за кадр и срезал буквы. Оба дефекта видны только на кадре. Поэтому проверяются кадры, а не код выхода.

Озвучка делается отдельным шагом и не в Manim: t2v или media-use.

Ступень 4: курс, когда нужно системно

Когда одна непонятая тема тянет за собой десяток смежных, по одной схеме не дойти. Здесь нужен план темы и практикум, где знание сразу проверяется действием.

course-program-design планирует программу, course-authoring ведёт её от первого урока до последнего. Собирается такой курс из тех же кусков: схема, потом ролик по одному механизму, потом практикум.

Три примера применения

Учёба. Сначала схема устройства подсистемы, потом ролик с одним механизмом, потом практикум. Сорок страниц текста читаются хуже, чем страница с пятью схемами и ролик на две минуты.

Рабочие материалы. Инструкция из двенадцати шагов, написанная одним абзацем, читается медленно и с потерями. Тот же текст после прохода по STE-правилам: один шаг на строку, конкретный исполнитель у каждого действия. Отдельно ловятся маркетинговые прилагательные - надёжный, гибкий, масштабируемый в инструкции не знают ничего, пока рядом не стоит измерение.

Погружение в новый проект. Порядок обратный: сначала обзор кода, потом схема потока данных по главному сценарию, потому что структуру чужого репозитория текстом не разобрать. Видео нужно ровно в одном месте, где логика неочевидна.

Сколько это стоит

Текст: один вызов. Схема: минута. Ролик: почти столько же, сколько его длительность. Курс с практикумами - дни, но он собирается из кусков, каждый проходит через те же ступени.

Когда это не нужно

Когда не просили разобраться и нужен просто ответ. Диспетчер включается по запросу или по провалу предыдущей попытки, а не перед каждым объяснением.

И когда времени мало: дешёвый первый шаг это не про дешёвое качество, а про то, чтобы не тратить час на ролик, который не нужен.

Как поставить с нуля

# положить набор в каталог скиллов профиля
cp -r teachme-bundle/skills/* ~/.hermes/skills/

# пересчитать реестр команд
/reload-skills

# проверить, что всё на месте
find skills -name SKILL.md | wc -l        # ожидается 29
hermes skills list | grep -E "teachme|eli5|asd-ste100"

Без /reload-skills имя не появится в автоподсказке: реестр команд кэшируется при старте сессии. Сам файл виден - скиллы читаются с диска напрямую.

Для роликов с формулами нужен LaTeX, иначе рендер падает. Скрипт materials/scripts/setup-latex.sh ставит его целиком и идемпотентно.

Что лежит в репозитории

Отчуждаемая копия скилов teachme: 29 папок, 8 МБ, симлинки разыменованы. Нужна для переноса на другую машину и для страховки от куратора, который архивирует то, чем давно не пользовались.

Ролик про LLM Wiki: materials/llmwiki.mp4, код сцен: materials/llmwiki_video.py.

Итог

Модели отвечают одинаково хорошо на любой вопрос. Разница между двумя ответами одного человека в том, что один из них отдан в подходящем формате.

Лестница из четырёх ступеней - это не про то, что сложное надо объяснять видео. Это про то, чтобы не начинать с дорогого и не останавливаться на дешёвом, когда дешёвое не сработало.