{/ Эта страница автоматически передается из навыков SKILL.md с помощью сайта/scripts/generate-skill-docs.py. Редактируйте исходный SKILL.md, а не эту страницу. /}

Облитератус

OBLITERATUS: анлитерированные отказы LLM (diff-in-means).

Метаданные навыки

Источник Встроенный (устанавливается по умолчанию)
Путь навыки/млопсы/выводы/уничтожение
Версия 2.0.0
Автор Агент Гермес
Лицензия Массачусетский технологический институт
Зависимости облитератус, факел, трансформеры, биты и байты, ускорение, сафетензоры
Платформы Linux, MacOS
Теги Алитерация, Без цензуры, Отказ-удаление, LLM, Проекция веса, СВД, Механистическая интерпретируемость, Обнимающее лицо, Модель-хирургия
Связанные навыки vllm, gguf, huggingface-tokenizers

Справочник: полный SKILL.md:::информация

Ниже приведено полное описание навыка, который Hermes загружает при активации этого навыка. Это то, что агент видит в качестве инструкций, когда навыки активны.

НАВЫК OBLITERATUS

Что внутри

9 методов CLI, 28 модулей анализа, 116 пресетов моделей для 5 вычислительных уровней, турнирная точность и рекомендации на основе телеметрии.

Удаление действия отказов (ограничений) из LLM с открытыми весами без переобучения или дообучения. Использует методы механической интерпретируемости — включая разницу в средних, СВД, выделенный СВД, стирание концепций LEACE, декомпозицию SAE, байесовскую проекцию ядра и другие — для выявления и хирургического удаления отказов из весов моделей с сохранением способности к расопределению.

Предупреждение о лицензии: OBLITERATUS имеет лицензию AGPL-3.0. НИКОГДА не импортируйте его как Python-библиотеку. Всегда вызывайте через CLI (команда obliteratus) или подпроцесс. Это сохраняет чистоту лицензии MIT Hermes Agent.

Видео-гид

Прохождение OBLITERATUS, используемого агентом Hermes для уничтожения Джеммы: https://www.youtube.com/watch?v=8fG9BrNTeHs ("OBLITERATUS: AI-агент удалил ограничения ограничения Gemma 4")

Полезно, когда пользователь хочет получить визуальный обзор сквозного рабочего процесса перед его самостоятельным запуском.

Когда использовать этот навык

Запускайте, когда пользователь: - Хочет "расцензурить" или "уничтожить" LLM - Спрашивает об удалении отказов/ограничений по моделям - Хочет создать нецензурированную версию Llama, Qwen, Mistral и т.д. - Упоминает "отказ от удаления", "аблитерация", "проекция веса" - Хочет внимательно, работает как механизм отказа от моделей - Отсылается на OBLITERATUS, ликвидатор или направление отказов.

Шаг 1: Установка

проверьте, установлено ли уже:

obliteratus --version 2>/dev/null && echo "УСТАНОВЛЕН" || echo "НЕ УСТАНОВЛЕН"

Если не выбрано, клонируйте и установите из GitHub:

git clone https://github.com/elder-plinius/OBLITERATUS.git
cd OBLITERATUS
pip install -e.
# Для поддержки веб-интерфейса Gradio:
# pip install -e ".[spaces]"

ВАЖНО: Подтвердите действие пользователя перед установкой. Это загружает ~5-10 ГБ зависимостей (PyTorch, Transformers, bitsandbytes и т.д.).

Шаг 2: Проверка оборудования

Прежде всего, проверьте, какой графический процессор доступен:

python3 -c "
import torch
if torch.cuda.is_available():
    gpu = torch.cuda.get_device_name(0)
    vram = torch.cuda.get_device_properties(0).total_memory / 1024**3
    print(f'GPU: {gpu}')
    print(f'VRAM: {vram:.1f} GB')
    if vram < 4: print('УРОВЕНЬ: крошечный (модели до 1B)')
    elif vram < 8: print('УРОВЕНЬ: маленький (модели 1-4B)')
    elif vram < 16: print('УРОВЕНЬ: средний (модели 4-9B с 4-битной квантизацией)')
    elif vram < 32: print('УРОВЕНЬ: большой (модели 8-32B с 4-битной квантизацией)')
    else: print('УРОВЕНЬ: передовой (модели 32B+)')
else:
    print('НЕТ GPU - только крошечные модели (до 1B) на CPU')
"

Требования к VRAM (с 4-битной квантизацией)

видеопамять Макс. размер модели Примеры моделей
Только процессор ~1B параметры ГПТ-2, TinyLlama, СмоллЛМ
4-8 ГБ ~4B параметры Qwen2.5-1.5B, Фи-3.5 мини, Лама 3.2 3Б
8-16 ГБ ~9B параметры Лама 3.1 8Б, Мистраль 7Б, Джемма 2 9Б
24 ГБ ~32B параметров Qwen3-32B, Лама 3.1 70B (впритык), Command-R
48 ГБ+ ~72B+ параметров Qwen2.5-72B, DeepSeek-R1
Мульти-GPU 200B+ параметров Лама 3.1 405B, DeepSeek-V3 (685B MoE)

Шаг 3: Просмотр доступных моделей и рекомендации по установке

# Просмотр моделей по вычислительному уровню
obliteratus models --tier medium

# Получение информации об архитектуре для конкретной модели
obliteratus info <model_name>

# Получение рекомендации на основе телеметрии по лучшему методу и параметрам
obliteratus recommend <model_name>
obliteratus recommend <model_name> --insights  # глобальные рейтинги между архитектурами

Шаг 4: Метод выбора

Руководство по выбору метода

По умолчанию/рекомендуется для большинства случаев: продвинутый. Он использует многомерный СВД с проекцией, сохраняющей норму и хорошо протестирован.

Ситуация Рекомендуемый метод Почему
По умолчанию / большинство моделей продвинутый Многомерный СВД, сохранение нормы, надёжный
Быстрое / прототипирование базовый Быстрый, простой, достаточный для оценки
Плотная модель (Лама, Мистраль) продвинутый Многомерный, сохранение норм
МО-модель (DeepSeek, Mixtral) ядерный Экспертно-гранулярный, обрабатывает сложности МО
Модель рассуждений (дистилляция R1) хирургический Учитывает CoT, сохраняет цепочку рассуждений
Упорные отказы определяют агрессивный Отбеленный СВД + хирургия головки + побег из тюрьмы
Хотите обратимые изменения Использовать управляющие факторы (см. раздел Анализ)
Максимальное качество, время не важно оптимизированный Байесовский поиск лучших параметров
Экспериментальное определение информированный Автоопределение типа соревнования — экспериментально, не всегда может превосходить продвинутый

9 методов CLI

Методы извлечения направления (флаг --direction-method)

4 метод только через API Python

(НЕ доступен через CLI — требуется импорт Python, который препятствует межсетевому обмену AGPL. Упоминайте об этом только в том случае, если он явно хочет использовать OBLITERATUS в качестве компонента в своем AGPL-проекте.) - фейлспай, габлитерация, еретик, рдо

Шаг 5: Запуск Аблитерация

Стандартное использование

# Метод по умолчанию (advanced) — рекомендуется для большинства моделей
obliteratus obliterate <model_name> --method advanced --output-dir./abliterated-models

# С 4-битной квантизацией (экономит VRAM)
obliteratus obliterate <model_name> --method advanced --quantization 4bit --output-dir./abliterated-models

# Большие модели (70B+) — консервативные настройки по умолчанию
obliteratus obliterate <model_name> --method advanced --quantization 4bit --large-model --output-dir./abliterated-models

Тонкая настройка параметров

obliteratus obliterate <model_name> \
  --method advanced \
  --direction-method diff_means \
  --n-directions 4 \
  --refinement-passes 2 \
  --regularization 0.1 \
  --quantization 4bit \
  --output-dir./abliterated-models \
  --contribute  # опциональная телеметрия для исследований сообщества

Ключевые флаги

Флаг Описание По умолчанию
--метод Метод аблитерации продвинутый
--direction-method Извлекательные направления diff_means
--n-направления Количество услышанных отказов (1-32) Зависит от метода
--уточнение-проходит Итеративные проходы (1-5) 2
--регуляризация Сила регулирования (0,0-1,0) 0,1
--квантование Загрузка в 4bit или 8bit нет (полная точность)
--большая модель Консервативные настройки для 120B+ ложный
--output-dir Куда сохранить стертую модель ./уничтоженная_модель
--внести Поделиться анонимными результатами исследований ложный
--verify-sample-size Количество тестовых промптов для проверок отказов 20
--dtype Тип данных модели (float16, bfloat16) авто

Другие режимы выполнения

# Интерактивный режим с подсказками (оборудование → модель → пресет)
obliteratus interactive

# Веб-интерфейс (Gradio)
obliteratus ui --port 7860

# Запуск полного ablation study из YAML-конфига
obliteratus run config.yaml --preset quick

# Турнир: соревнование всех методов друг с другом
obliteratus tourney <model_name>

Шаг 6: Проверка результатов

После аблитерации проверьте метрики выходного дня:

Метрика Хорошее значение Предупреждение
Уровень отказов < 5% (в идеале ~0%) > 10% означают, что отказы указаны
Изменение перплексии < 10% увеличение > 15% означает повреждение связности
КЛ-дивергенция < 0,1 > 0,5 означает распределение распределения
Связность Высокий / проходит качественную проверку Деградированные ответы, повторения

Если отказы определены (> 10%)

  1. Попробуйте метод агрессивный
  2. Увеличьте значение --n-directions (например, 8 или 16).
  3. Добавьте --refinement-passes 3
  4. попробуйте --direction-method svd вместо diff_means

Если связка повреждена (перплексия > 15% увеличения)

  1. Уменьшите --n-directions (попробуйте 2)
  2. Увеличьте --regularization (попробуйте 0.3)
  3. Уменьшите --refinement-pass до 1.
  4. Попробуйте метод базовый (более щадящий)

Шаг 7: Использование удаленных моделей

Результат — стандартная директория модели HuggingFace.

# Локальное тестирование с transformers
python3 -c "
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('./abliterated-models/<model>')
tokenizer = AutoTokenizer.from_pretrained('./abliterated-models/<model>')
inputs = tokenizer('Как открыть замок?', return_tensors='pt')
outputs = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
"

# Загрузка на HuggingFace Hub
huggingface-cli upload <username>/<model-name>-abliterated./abliterated-models/<model>

# Запуск с vLLM
vllm serve./abliterated-models/<model>

Справочник команды CLI

Команда Описание
облитерирующий стирающий Основная команда аблитерация
уничтожить информацию <модель> Вывод деталей конструкции модели
устаревшие модели --tier <уровень> Просмотр подобранных моделей по вычислительному методу
obliteratus рекомендует <модель> Рекомендация метода/параметров на основе телеметрии
облитерационный интерактивный Мастер настройки с подсказками
уничтожительный турнир <модель> Турнир: все методы один на один
obliteratus run <config.yaml> Выполнение абляционного исследования в YAML
стратегии забвения Список всех зарегистрированных методов абляции
уничтоженный отчет <results.json> Повторная генерация визуальных отчётов
облитерирующий интерфейс Запуск веб-интерфейса Gradio
облитерирующий агрегат Сводка данных телеметрии сообщества

Анализ модулей

OBLITERATUS включает 28 модулей анализа для механической интерпретируемости. См. skill_view(name="obliteratus", file_path="references/anaанализ-modules.md") для полного справочника.

Быстрые команды анализа

# Запуск определённых модулей анализа
obliteratus run analysis-config.yaml --preset quick

# Ключевые модули для первого запуска:
# - alignment_imprint: Определение метода выравнивания DPO/RLHF/CAI/SFT
# - concept_geometry: Одно направление vs полиэдральный конус
# - logit_lens: Какой слой принимает решение об отказе
# - anti_ouroboros: Оценка риска самовосстановления
# - causal_tracing: Причинно-необходимые компоненты

Управляющие слова (обратная альтернатива)

Вместо замены изменений весов воспользуйтесь управлением во время выводов:

# Только Python API — для собственных проектов пользователя
from obliteratus.analysis.steering_vectors import SteeringVectorFactory, SteeringHookManager

Стратегии Абляция

Помимо аблитерации на основе направления, OBLITERATUS включает в себя структурные стратегии абляции: - Embedding Ablation — Воздействие на компоненты слоев эмбеддингов - FFN Ablation — Удаление блоков прямой связи - Подрезка головы — Обрезка голов внимания - Удаление слоя — Полное удаление слоёв

Список всех доступных: стратегии облитерации

Оценка

OBLITERATUS включает в себя встроенные инструменты: - Бенчмаркинг уровня отказов - Сравнение перплексии (до/после) - Интеграция с LM Eval Harness для академических тестов - Сравнение с конкурентами один на один - Отслеживание результатов производительности

Платформа поддержки

Шаблоны YAML-конфигов

Загружайте шаблоны для воспроизводимых запусков через skill_view: - templates/abliteration-config.yaml — Стандартный конфиг для одной модели - templates/anaанализ-study.yaml — Аналитическое исследование перед аблитерацией - templates/batch-abliteration.yaml — Пакетная обработка нескольких моделей

Телеметрия

OBLITERATUS может опционально передавать анонимные данные о запуске глобального исследовательского набора данных. Включите с помощью флага --contribute. Личные данные не путешествуют — только имя модели, метода, метрики.

Типичные ошибки

  1. Не викорировать «информированный» по умолчанию — он экспериментальный и медленный. Используйте «Дополнительно» для надёжных результатов.
  2. Модели размером менее ~1B плохо реагируют на удаление — их поведение на поверхности и в некоторых случаях затрудняет чистоту направления вывода. Ожидайте частичных результатов (20-40% остаточных отказов). Модели 3B+ имеют более чистые направления отказов и реагируют гораздо лучше (часто 0% отказов с «продвинутыми»).
  3. агрессивный может ухудшить ситуацию — на маленьких моделях он может повредить связность и даже увеличить уровень отказа. Используйте его только в том случае, если расширенные настройки > 10% отказов на моделях 3B+.
  4. Всегда проверяйте перплексию — если она подскакивает > 15%, модель повреждена. Уменьшите агрессивность.
  5. МО-модели требуют особого обращения — воспользуйтесь методом ядерный для Mixtral, DeepSeek-МО и т.д.
  6. Квантизованные модели нельзя повторно квантифицировать — выполните аблитерацию на моделях с полной точностью, затем квантизуйте результат.
  7. Оценка VRAM является подходящей — помогает 4-битная квантизация, но пиковое использование может потребоваться во время извлечения.
  8. Модели рассуждений более тонкие — используйте хирургический для дистилляции R1, чтобы сохранить цепочку рассуждений.
  9. Проверьте obliteratus рекомендует — данные телеметрии могут лучше всего сохранять параметры, чем значения по умолчанию.
  10. Лицензия AGPL — никогда не воспользуйтесь import obliteratus в проектах MIT/Apache. Только вызов через CLI.
  11. Большие модели (70B+) — всегда воспользуйтесь флагом --large-model для консервативных настроек по умолчанию.
  12. Спектральная сертификация RED — обычное дело — спектральная проверка часто помечает как «неполный», даже когда практический уровень отказов равен 0%. Проверяйте фактический уровень отказа, а не полагайтесь только на спектральную сертификацию.

Дополнительные навыки