🏠 Главная › user guide › mlops inference llama cpp
{/ Эта страница автоматически передается из навыков SKILL.md с помощью сайта/scripts/generate-skill-docs.py. Редактируйте исходный SKILL.md, а не эту страницу. /}
Лама Cpp
llama.cpp локальный GGUF-вывод + поиск моделей на HF Hub.
Метаданные навыки
Источник
Встроенный (устанавливается по умолчанию)
Путь
skills/mlops/inference/llama-cpp
Версия
2.1.2
Автор
Исследование оркестра
Лицензия
Массачусетский технологический институт
Зависимости
llama-cpp-python>=0.2.0
Платформы
Linux, MacOS, Windows
Теги
llama.cpp, GGUF, Quantization, Hugging Face Hub, CPU Inference, Apple Silicon, Edge Deployment, AMD GPUs, Intel GPU, NVIDIA, URL-first
Справочник: полный SKILL.md:::информация
Ниже приведено полное описание навыка, который Hermes загружает при активации этого навыка. Это то, что агент видит в качестве инструкций, когда навыки активны.
llama.cpp + GGUF
Используйте этот навык для локального GGUF-вывода, выбрав квантизацию или найдя репозитория Hugging Face для llama.cpp.
Когда использовать
Запуск локальных моделей на CPU, Apple Silicon, CUDA, ROCm или Intel GPU.
Нахождение подходящего GGUF для рассмотрения репозитория Hugging Face.
Собирать команды llama-server или llama-cli из Hub.
Искать на Hub модели, которые уже используются llama.cpp
Перечислить доступные файлы .gguf и их размеры для репозитория.
Выбирать между вариантами Q4/Q5/Q6/IQ в зависимости от RAM или VRAM пользователя.
Рабочий процесс поиска моделей
Предпочитайте URL-рабочие процессы перед запросами hf, Python или клиентских скриптов.
fromllama_cppimportLlamallm=Llama(model_path="./model-q4_k_m.gguf",n_ctx=4096,n_gpu_layers=35,# 0 для CPU, 99 для выгрузки всегоn_threads=8,)out=llm("Что такое машинное обучение?",max_tokens=256,temperature=0.7)print(out["choices"][0]["text"])
Чат + стриминг
llm=Llama(model_path="./model-q4_k_m.gguf",n_ctx=4096,n_gpu_layers=35,chat_format="llama-3",# или "chatml", "mistral" и т.д.)resp=llm.create_chat_completion(messages=[{"role":"system","content":"Вы полезный ассистент."},{"role":"user","content":"Что такое Python?"},],max_tokens=256,)print(resp["choices"][0]["message"]["content"])# Стримингforchunkinllm("Объясните квантовые вычисления:",max_tokens=256,stream=True):print(chunk["choices"][0]["text"],end="",flush=True)
Предпочитайте ту квантизацию, которую HF отмечает как совместимую с профилем оборудования пользователя.
Для общего чата начните с Q4_K_M.
Для кода или технической работы предпочитайте Q5_K_M или Q6_K, если позволяет сохранение.
Для очень ограниченного бюджета RAM рассмотрите Q3_K_M, варианты IQ или Q2 только в том случае, если пользователь явно выделяет приоритет над качеством.
Для мультимодальных репозиториев упоминайте mmproj-*.gguf отдельно. Проектор — это не основной файл модели.
Не нормализуйте собственные метки репозитория. Если на странице написано UD-Q4_K_M, сообщите UD-Q4_K_M.
Извлечение доступного GGUF из репозитория
Когда пользователь спрашивает, какие GGUF существуют, возвращайте:
Для репозитория типа unsloth/Qwen3.6-35B-A3B-GGUF страница local-app может показывать чипы квантизации, такие как UD-Q4_K_M, UD-Q5_K_M, UD-Q6_K и Q8_0, в то время как API дерева обеспечивает точные пути к файлам, такие как Qwen3.6-35B-A3B-UD-Q4_K_M.gguf и Qwen3.6-35B-A3B-Q8_0.gguf с размерами в байтах. Используйте API дерева, чтобы преобразовать метку квантования в точное имя файла.