{/ Эта страница автоматически создается на основе файла SKILL.md навыка с помощью сайта site/scripts/generate-skill-docs.py. Редактируйте исходный код SKILL.md, а не эту страницу. /}
Обучение Slime Rl
Содержит рекомендации по пост-обучению LLM с использованием RL с использованием Slime, платформы Megatron + SGLang. Используйте при обучении моделей GLM, реализации пользовательских рабочих процессов создания данных или при необходимости тесной интеграции Megatron-LM для масштабирования RL.
Метаданные навыков
| Источник | Необязательно — установите с помощью hermesskills installofficial/mlops/slime |
| Путь | необязательные-навыки/mlops/slime |
| Версия | 1.0.0 |
| Автор | Исследование оркестра |
| Лицензия | Массачусетский технологический институт |
| Зависимости | sglang-router>=0.2.3, ray, torch>=2.0.0, transformers>=4.40.0 |
| Платформы | Linux, MacOS |
| Теги | Обучение с подкреплением, Мегатрон-LM, SGLang, GRPO, Пост-обучение, GLM |
Ссылка: полная версия SKILL.md:::информация
Ниже приведено полное определение навыка, которое Гермес загружает при активации этого навыка. Это то, что агент видит в качестве инструкций, когда навык активен.