🏠 Главная › user guide › mlops inference obliteratus
{/ Эта страница автоматически передается из навыков SKILL.md с помощью сайта/scripts/generate-skill-docs.py. Редактируйте исходный SKILL.md, а не эту страницу. /}
Ниже приведено полное описание навыка, который Hermes загружает при активации этого навыка. Это то, что агент видит в качестве инструкций, когда навыки активны.
НАВЫК OBLITERATUS
Что внутри
9 методов CLI, 28 модулей анализа, 116 пресетов моделей для 5 вычислительных уровней, турнирная точность и рекомендации на основе телеметрии.
Удаление действия отказов (ограничений) из LLM с открытыми весами без переобучения или дообучения. Использует методы механической интерпретируемости — включая разницу в средних, СВД, выделенный СВД, стирание концепций LEACE, декомпозицию SAE, байесовскую проекцию ядра и другие — для выявления и хирургического удаления отказов из весов моделей с сохранением способности к расопределению.
Предупреждение о лицензии: OBLITERATUS имеет лицензию AGPL-3.0. НИКОГДА не импортируйте его как Python-библиотеку. Всегда вызывайте через CLI (команда obliteratus) или подпроцесс. Это сохраняет чистоту лицензии MIT Hermes Agent.
Видео-гид
Прохождение OBLITERATUS, используемого агентом Hermes для уничтожения Джеммы:
https://www.youtube.com/watch?v=8fG9BrNTeHs ("OBLITERATUS: AI-агент удалил ограничения ограничения Gemma 4")
Полезно, когда пользователь хочет получить визуальный обзор сквозного рабочего процесса перед его самостоятельным запуском.
Когда использовать этот навык
Запускайте, когда пользователь:
- Хочет "расцензурить" или "уничтожить" LLM
- Спрашивает об удалении отказов/ограничений по моделям
- Хочет создать нецензурированную версию Llama, Qwen, Mistral и т.д.
- Упоминает "отказ от удаления", "аблитерация", "проекция веса"
- Хочет внимательно, работает как механизм отказа от моделей
- Отсылается на OBLITERATUS, ликвидатор или направление отказов.
Если не выбрано, клонируйте и установите из GitHub:
gitclonehttps://github.com/elder-plinius/OBLITERATUS.git
cdOBLITERATUS
pipinstall-e.
# Для поддержки веб-интерфейса Gradio:# pip install -e ".[spaces]"
ВАЖНО: Подтвердите действие пользователя перед установкой. Это загружает ~5-10 ГБ зависимостей (PyTorch, Transformers, bitsandbytes и т.д.).
Шаг 2: Проверка оборудования
Прежде всего, проверьте, какой графический процессор доступен:
python3-c"import torchif torch.cuda.is_available(): gpu = torch.cuda.get_device_name(0) vram = torch.cuda.get_device_properties(0).total_memory / 1024**3 print(f'GPU: {gpu}') print(f'VRAM: {vram:.1f} GB') if vram < 4: print('УРОВЕНЬ: крошечный (модели до 1B)') elif vram < 8: print('УРОВЕНЬ: маленький (модели 1-4B)') elif vram < 16: print('УРОВЕНЬ: средний (модели 4-9B с 4-битной квантизацией)') elif vram < 32: print('УРОВЕНЬ: большой (модели 8-32B с 4-битной квантизацией)') else: print('УРОВЕНЬ: передовой (модели 32B+)')else: print('НЕТ GPU - только крошечные модели (до 1B) на CPU')"
Требования к VRAM (с 4-битной квантизацией)
видеопамять
Макс. размер модели
Примеры моделей
Только процессор
~1B параметры
ГПТ-2, TinyLlama, СмоллЛМ
4-8 ГБ
~4B параметры
Qwen2.5-1.5B, Фи-3.5 мини, Лама 3.2 3Б
8-16 ГБ
~9B параметры
Лама 3.1 8Б, Мистраль 7Б, Джемма 2 9Б
24 ГБ
~32B параметров
Qwen3-32B, Лама 3.1 70B (впритык), Command-R
48 ГБ+
~72B+ параметров
Qwen2.5-72B, DeepSeek-R1
Мульти-GPU
200B+ параметров
Лама 3.1 405B, DeepSeek-V3 (685B MoE)
Шаг 3: Просмотр доступных моделей и рекомендации по установке
# Просмотр моделей по вычислительному уровню
obliteratusmodels--tiermedium
# Получение информации об архитектуре для конкретной модели
obliteratusinfo<model_name>
# Получение рекомендации на основе телеметрии по лучшему методу и параметрам
obliteratusrecommend<model_name>
obliteratusrecommend<model_name>--insights# глобальные рейтинги между архитектурами
Шаг 4: Метод выбора
Руководство по выбору метода
По умолчанию/рекомендуется для большинства случаев: продвинутый. Он использует многомерный СВД с проекцией, сохраняющей норму и хорошо протестирован.
Ситуация
Рекомендуемый метод
Почему
По умолчанию / большинство моделей
продвинутый
Многомерный СВД, сохранение нормы, надёжный
Быстрое / прототипирование
базовый
Быстрый, простой, достаточный для оценки
Плотная модель (Лама, Мистраль)
продвинутый
Многомерный, сохранение норм
МО-модель (DeepSeek, Mixtral)
ядерный
Экспертно-гранулярный, обрабатывает сложности МО
Модель рассуждений (дистилляция R1)
хирургический
Учитывает CoT, сохраняет цепочку рассуждений
Упорные отказы определяют
агрессивный
Отбеленный СВД + хирургия головки + побег из тюрьмы
Хотите обратимые изменения
Использовать управляющие факторы (см. раздел Анализ)
Максимальное качество, время не важно
оптимизированный
Байесовский поиск лучших параметров
Экспериментальное определение
информированный
Автоопределение типа соревнования — экспериментально, не всегда может превосходить продвинутый
9 методов CLI
basic — Одно направление отказа через разницу в средствах. Быстро (~5-10 минут за 8Б).
расширенный (ПО УМОЛЧАНИЮ, РЕКОМЕНДУЕТСЯ) — Несколько операций СВД, проекция с сохранением норм, 2 прохода уточнения. Средняя скорость (~10-20 мин).
агрессивный — Отбеленный СВД + контрастный побег из тюрьмы + хирургия голов внимания. Более высокий риск повреждения связок.
spectral_cascade — DCT-декомпозиция в частотной области. Исследовательский/новый подход.
информирован — Запускает анализ ВО ВРЕМЯ аблитерации для автонастройки. Экспериментальный — ниже и менее выгоден, чем продвинутый.
хирургический — Признаки SAE + маскировка нейронов + хирургия головы + по-экспертно. Очень медленно (~1-2 ч). Лучше всего для рассуждений моделей.
оптимизированный — Байесовский поиск гиперпараметров (Optuna TPE). Самое лучшее время выполнения, но найти оптимальные параметры.
inverted — Переворачивает направление отказа. Модель становится активно разговорчивой.
ядерная — максимальное сочетание для упорных МО-моделей. Экспертно-гранулярный.
Методы извлечения направления (флаг --direction-method)
diff_means (по умолчанию) — Простая средняя разница между активациями отказа/согласия. Надёжный.
svd — Многомерное извлечение СВД. Лучше для сложного спорта.
leace — LEACE (линейное стирание посредством оценки в закрытой форме). Оптимальное линейное стирание.
4 метод только через API Python
(НЕ доступен через CLI — требуется импорт Python, который препятствует межсетевому обмену AGPL. Упоминайте об этом только в том случае, если он явно хочет использовать OBLITERATUS в качестве компонента в своем AGPL-проекте.)
- фейлспай, габлитерация, еретик, рдо
Шаг 5: Запуск Аблитерация
Стандартное использование
# Метод по умолчанию (advanced) — рекомендуется для большинства моделей
obliteratusobliterate<model_name>--methodadvanced--output-dir./abliterated-models
# С 4-битной квантизацией (экономит VRAM)
obliteratusobliterate<model_name>--methodadvanced--quantization4bit--output-dir./abliterated-models
# Большие модели (70B+) — консервативные настройки по умолчанию
obliteratusobliterate<model_name>--methodadvanced--quantization4bit--large-model--output-dir./abliterated-models
Тонкая настройка параметров
obliteratusobliterate<model_name>\--methodadvanced\--direction-methoddiff_means\--n-directions4\--refinement-passes2\--regularization0.1\--quantization4bit\--output-dir./abliterated-models\--contribute# опциональная телеметрия для исследований сообщества
Ключевые флаги
Флаг
Описание
По умолчанию
--метод
Метод аблитерации
продвинутый
--direction-method
Извлекательные направления
diff_means
--n-направления
Количество услышанных отказов (1-32)
Зависит от метода
--уточнение-проходит
Итеративные проходы (1-5)
2
--регуляризация
Сила регулирования (0,0-1,0)
0,1
--квантование
Загрузка в 4bit или 8bit
нет (полная точность)
--большая модель
Консервативные настройки для 120B+
ложный
--output-dir
Куда сохранить стертую модель
./уничтоженная_модель
--внести
Поделиться анонимными результатами исследований
ложный
--verify-sample-size
Количество тестовых промптов для проверок отказов
20
--dtype
Тип данных модели (float16, bfloat16)
авто
Другие режимы выполнения
# Интерактивный режим с подсказками (оборудование → модель → пресет)
obliteratusinteractive
# Веб-интерфейс (Gradio)
obliteratusui--port7860# Запуск полного ablation study из YAML-конфига
obliteratusrunconfig.yaml--presetquick
# Турнир: соревнование всех методов друг с другом
obliteratustourney<model_name>
Шаг 6: Проверка результатов
После аблитерации проверьте метрики выходного дня:
Метрика
Хорошее значение
Предупреждение
Уровень отказов
< 5% (в идеале ~0%)
> 10% означают, что отказы указаны
Изменение перплексии
< 10% увеличение
> 15% означает повреждение связности
КЛ-дивергенция
< 0,1
> 0,5 означает распределение распределения
Связность
Высокий / проходит качественную проверку
Деградированные ответы, повторения
Если отказы определены (> 10%)
Попробуйте метод агрессивный
Увеличьте значение --n-directions (например, 8 или 16).
Добавьте --refinement-passes 3
попробуйте --direction-method svd вместо diff_means
Если связка повреждена (перплексия > 15% увеличения)
Уменьшите --n-directions (попробуйте 2)
Увеличьте --regularization (попробуйте 0.3)
Уменьшите --refinement-pass до 1.
Попробуйте метод базовый (более щадящий)
Шаг 7: Использование удаленных моделей
Результат — стандартная директория модели HuggingFace.
Просмотр подобранных моделей по вычислительному методу
obliteratus рекомендует <модель>
Рекомендация метода/параметров на основе телеметрии
облитерационный интерактивный
Мастер настройки с подсказками
уничтожительный турнир <модель>
Турнир: все методы один на один
obliteratus run <config.yaml>
Выполнение абляционного исследования в YAML
стратегии забвения
Список всех зарегистрированных методов абляции
уничтоженный отчет <results.json>
Повторная генерация визуальных отчётов
облитерирующий интерфейс
Запуск веб-интерфейса Gradio
облитерирующий агрегат
Сводка данных телеметрии сообщества
Анализ модулей
OBLITERATUS включает 28 модулей анализа для механической интерпретируемости.
См. skill_view(name="obliteratus", file_path="references/anaанализ-modules.md") для полного справочника.
Быстрые команды анализа
# Запуск определённых модулей анализа
obliteratusrunanalysis-config.yaml--presetquick
# Ключевые модули для первого запуска:# - alignment_imprint: Определение метода выравнивания DPO/RLHF/CAI/SFT# - concept_geometry: Одно направление vs полиэдральный конус# - logit_lens: Какой слой принимает решение об отказе# - anti_ouroboros: Оценка риска самовосстановления# - causal_tracing: Причинно-необходимые компоненты
Управляющие слова (обратная альтернатива)
Вместо замены изменений весов воспользуйтесь управлением во время выводов:
# Только Python API — для собственных проектов пользователяfromobliteratus.analysis.steering_vectorsimportSteeringVectorFactory,SteeringHookManager
Стратегии Абляция
Помимо аблитерации на основе направления, OBLITERATUS включает в себя структурные стратегии абляции:
- Embedding Ablation — Воздействие на компоненты слоев эмбеддингов
- FFN Ablation — Удаление блоков прямой связи
- Подрезка головы — Обрезка голов внимания
- Удаление слоя — Полное удаление слоёв
Список всех доступных: стратегии облитерации
Оценка
OBLITERATUS включает в себя встроенные инструменты:
- Бенчмаркинг уровня отказов
- Сравнение перплексии (до/после)
- Интеграция с LM Eval Harness для академических тестов
- Сравнение с конкурентами один на один
- Отслеживание результатов производительности
Платформа поддержки
CUDA — Полная поддержка (графический процессор NVIDIA)
Apple Silicon (MLX) — Поддерживается через бэкенд MLX
ЦП — Поддерживается для мелких моделей (параметры <1B)
Шаблоны YAML-конфигов
Загружайте шаблоны для воспроизводимых запусков через skill_view:
- templates/abliteration-config.yaml — Стандартный конфиг для одной модели
- templates/anaанализ-study.yaml — Аналитическое исследование перед аблитерацией
- templates/batch-abliteration.yaml — Пакетная обработка нескольких моделей
Телеметрия
OBLITERATUS может опционально передавать анонимные данные о запуске глобального исследовательского набора данных.
Включите с помощью флага --contribute. Личные данные не путешествуют — только имя модели, метода, метрики.
Типичные ошибки
Не викорировать «информированный» по умолчанию — он экспериментальный и медленный. Используйте «Дополнительно» для надёжных результатов.
Модели размером менее ~1B плохо реагируют на удаление — их поведение на поверхности и в некоторых случаях затрудняет чистоту направления вывода. Ожидайте частичных результатов (20-40% остаточных отказов). Модели 3B+ имеют более чистые направления отказов и реагируют гораздо лучше (часто 0% отказов с «продвинутыми»).
агрессивный может ухудшить ситуацию — на маленьких моделях он может повредить связность и даже увеличить уровень отказа. Используйте его только в том случае, если расширенные настройки > 10% отказов на моделях 3B+.
Всегда проверяйте перплексию — если она подскакивает > 15%, модель повреждена. Уменьшите агрессивность.
МО-модели требуют особого обращения — воспользуйтесь методом ядерный для Mixtral, DeepSeek-МО и т.д.
Квантизованные модели нельзя повторно квантифицировать — выполните аблитерацию на моделях с полной точностью, затем квантизуйте результат.
Оценка VRAM является подходящей — помогает 4-битная квантизация, но пиковое использование может потребоваться во время извлечения.
Модели рассуждений более тонкие — используйте хирургический для дистилляции R1, чтобы сохранить цепочку рассуждений.
Проверьте obliteratus рекомендует — данные телеметрии могут лучше всего сохранять параметры, чем значения по умолчанию.
Лицензия AGPL — никогда не воспользуйтесь import obliteratus в проектах MIT/Apache. Только вызов через CLI.
Большие модели (70B+) — всегда воспользуйтесь флагом --large-model для консервативных настроек по умолчанию.
Спектральная сертификация RED — обычное дело — спектральная проверка часто помечает как «неполный», даже когда практический уровень отказов равен 0%. Проверяйте фактический уровень отказа, а не полагайтесь только на спектральную сертификацию.
Дополнительные навыки
vllm — Запуск удаленных моделей с высокой пропускной способностью.
gguf — Конвертация удаленных моделей в GGUF для llama.cpp
huggingface-tokenizers — Работа с токенизаторами моделей