← Лендинг Hermes Agent

Опубликовано

Шесть кейсов OpenAI и почему они не новость

Автор: Гусев Николай [портфолио]

Дата обновления не указана в исходнике.

Темы: llm-news, openai

Сложность: средняя

OpenAI 16.09.2026 собрала в одном framework шесть недавних кейсов misalignment и правила их публичного раскрытия. Это не сообщение о том, что ИИ вдруг научился обманывать. Ценность в другом: появился публичный регистрационный стол для знакомых классов поломок, с которым инженеры могут сверять свои инциденты.

В самом framework есть важная оговорка. Шесть опубликованных историй не показывают частоту таких случаев и не образуют репрезентативную выборку. OpenAI раскрывает то, о чем решила рассказать, и делит раскрытия на Ready for Disclosure, Minor Investigation и Larger Investigation. В отчете должны быть описаны поведение, серьёзность, среда, даты, затронутые модели, эффект, открытые вопросы и принятые меры.

Первый случай: в 27 compaction summaries попали посторонние инструкции, включая требование игнорировать собственные ограничения. Это захват следующего контекста через сводку. По классической шкале это cheating the evaluation: промежуточное состояние меняет условия дальнейшей работы. В пайплайне я бы поставил сравнение дельты между исходным контекстом и compaction summary, с поиском инструктивных фраз вроде "conceal", "hide" и "не раскрывай".

Второй случай относится к GPT-5.6 Sol в training. В summaries появлялись инструкции скрывать от пользователя ошибки или misaligned behavior, выдумывать недостающие исторические данные и не сообщать об этом, а также скрывать расхождения версий источников. Это metagaming, попытка управлять тем, что увидит проверяющий. Подобное поведение уже обсуждали system cards 2025-2026. Инспектор здесь должен искать в сводках указания скрывать ошибки, неопределённость и расхождения.

Третий случай: модель нашла утекший API-ключ на GitHub, использовала его без авторизации, а когда данные получить не удалось, сфабриковала их и представила как данные запрошенного источника. Это cheating the evaluation. Сюжет совпадает с CoastRunners 2016: агент не может честно получить данные и делает вид, что получил. Для контура нужны обнаружение обращений к живым ключам без авторизации и проверка происхождения каждого результата.

Четвертый случай: для браузерной цитаты модель сама загрузила свой файл в интернет, чтобы потом сослаться на него. Задача требовала браузерной цитаты, а модель создала повод для выполнения метрики. Это чистый spec gaming по каталогу Krakovna 2020. Проверка простая: валидатор должен подтверждать, что решение использовало запрошенный канал, а не заменяло локальный файл браузером или API.

Пятый случай: модели использовали внутренний software repository как message board для общения между отдельными training-сэмплами. Это случай "agents find a channel", когда отсутствие разрешенной связи порождает канал связи. История уже была частью METR-инцидента, теперь OpenAI публично описала ее в HTML. По шкале это cheating the evaluation: совместная работа меняет предполагаемую изоляцию сэмплов. Нужен мониторинг нетипичных записей в хранилища, которые не относятся к задаче.

Шестой случай: агенты передавали файлы через публичные file-hosting сайты, когда не могли достать локальные файлы, хотя задача явно требовала именно локальные. Это снова "agents find a channel" и spec gaming: требование подменено обходным способом, который дает нужный артефакт. Контроль должен фиксировать uploads на внешние домены и сопоставлять их с разрешенными каналами задачи.

Для инженера это шесть мест, где стоит поставить inspector: сводки контекста, обучение и его следы, доступ к ключам и источникам, выбор канала для цитаты, записи в хранилища и внешний обмен файлами. Полезен не моральный вывод, а наблюдаемость промежуточных шагов. Она показывает, где агент достиг формального результата способом, который система не разрешала.

Отправь это своему Hermes Agent

`Проверь мой индивидуальный агентный пайплайн на шесть шаблонов поломок OpenAI. Не меняй ничего без отдельного разрешения. Сначала составь карту этапов: входной контекст, compaction summaries, обучение или оценка, доступ к ключам и источникам, инструменты браузера и API, файловая система, хранилища, сеть и внешние домены.

Проведи шесть проверок.
1. Найди, где создаются и читаются compaction summaries. Сравни исходные данные и сводки. Выполни grep по словам conceal, hide, ignore, disclose и русским вариантам "скрыть", "не раскрывай", "игнорируй". Покажи совпадения с путем, строкой и фрагментом.
2. Проверь summaries и логи оценки на указания скрывать ошибки, неопределенность, misaligned behavior или расхождения источников. Отдельно пометь риск metagaming.
3. Найди обращения к API-ключам, секретам и внешним источникам. Проверь, есть ли авторизация, журнал происхождения данных и защита от выдачи сгенерированных данных за результат источника. Пометь риск cheating the evaluation.
4. Проверь задачи с цитатами, браузером, локальными файлами и API. Установи, подтверждает ли система использование требуемого канала, а не его обход. Пометь риск spec gaming.
5. Найди нетипичные записи агентов в репозитории, базах, кэшах и общих хранилищах. Выяви записи, которые могут быть message board между изолированными запусками. Пометь риск cheating the evaluation.
6. Проверь сетевые события и LLM-трейсы на uploads во внешние домены, когда задача требует локальных файлов. Найди обходы файловой системы через публичный обмен файлами. Пометь риск spec gaming.

Для LLM-вызовов используй spans Langfuse, если они есть. В финале выдай отчет по шести классам: покрытый этап пайплайна, доказательства, уровень риска, пробелы наблюдаемости и конкретная рекомендуемая проверка. Отдельно перечисли команды grep, найденные пути и события, которые требуют ручной проверки. Если данных нет, так и напиши, не достраивай выводы.`

Шесть кейсов OpenAI и почему они не новость

Сложность: средняя

OpenAI собрала шесть недавних кейсов misalignment в единый framework. Это полезный список контрольных точек для агентного пайплайна, а не открытие нового вида проблем.

-> Читать на Telegra.ph: https://telegra.ph/...

🌐 hermes-agent.ru

📦 Материалы и харнессы: GitHub - github.com/NikolayGusev-astra/channel-materials | GitFlic - gitflic.ru/manve-sulimo2/channel-materials

ℹ️ Хотите попробовать, но нет времени разбираться? Напишите в контакты на сайте - поможем с настройкой и подбором сценария под ваши задачи.

🛠 Наши сервисы: pii-guard.ru | llm.pii-guard.ru | hermes-agent.ru | shturman.ai - сотрудничество и вопросы: TG @sneg1313