{/ Эта страница автоматически создается на основе файла SKILL.md навыка с помощью сайта site/scripts/generate-skill-docs.py. Редактируйте исходный код SKILL.md, а не эту страницу. /}
Обучение Симпо
Простая оптимизация предпочтений для спортивного LLM. Бесреференсная альтернатива DPO с лучшей производительностью (+6,4 балла по AlpacaEval 2.0). Не нужна референсная модель, эффективность DPO. Используйте для спортивных соревнований по предпочтениям, когда необходимо более простое и быстрое обучение, чем DPO/PPO.
Метаданные навыки
| Источник | Опционально — установка: hermeskills installofficial/mlops/simpo |
| Путь | optional-skills/mlops/simpo |
| Версия | 1.0.0 |
| Автор | Исследование оркестра |
| Лицензия | Массачусетский технологический институт |
| Зависимости | факел, трансформеры, наборы данных, трл, ускорение |
| Платформы | Linux, MacOS, Windows |
| Теги | «Пост-обучение», «SimPO», «Оптимизация предпочтений», «Выравнивание», «Альтернатива DPO», «Без справок», «Выравнивание LLM», «Эффективное обучение» |
Справочник: полный SKILL.md:::информация
Ниже приведено полное описание навыков, которые Hermes загружает при его активации. Агент увидит эту инструкцию, когда навыки активны.