{/ Эта страница автоматически передается из навыков SKILL.md с помощью сайта/scripts/generate-skill-docs.py. Редактируйте исходный SKILL.md, а не эту страницу. /}

Тензоррт Ллм

Оптимизирует вывод LLM с помощью NVIDIA TensorRT для более высокой пропускной способности и минимальной задержки. Используйте для продакшн-развертывания на графическом процессоре NVIDIA (A100/H100), когда требуется в 10–100 раз более быстрые выводы по сравнению с PyTorch, или для обслуживания моделей с квантованием (FP8/INT4), пакетной обработкой на лету и масштабированием на нескольких графических процессорах.

Метаданные навыки

Источник Опционально — установка: hermeskills installofficial/mlops/tensorrt-llm
Путь optional-skills/mlops/tensorrt-llm
Версия 1.0.0
Автор Исследование оркестра
Лицензия Массачусетский технологический институт
Зависимости tensorrt-llm, факел
Платформы Linux, MacOS
Теги «Обслуживание вывода», «TensorRT-LLM», «NVIDIA», «Оптимизация вывода», «Высокая пропускная способность», «Низкая задержка», «Производство», «FP8», «INT4», «Пакетная обработка в реальном времени», «Мульти-GPU»

Справочник: полный SKILL.md:::информация

Ниже приведено полное определение навыков, которые Hermes загружает при активации этого навыка. Это то, что агент видит в качестве инструкций, когда навыки активны.

ТензорРТ-LLM

Библиотека NVIDIA с открытым исходным кодом для оптимизации вывода LLM с передовой производительностью на графическом процессоре NVIDIA.

Когда использовать TensorRT-LLM

Используйте TensorRT-LLM когда: - Развертывание на графическом процессоре NVIDIA (A100, H100, GB200) - Нужна максимальная пропускная способность (24 000+ токенов/сек на Llama 3) - Требуется поддержка для приложений реального времени. - Работа с квантовыми моделями (FP8, INT4, FP4) - Масштабирование на нескольких GPU или узлах

Используйте vLLM вместо этого, когда: - Нужна более простая настройка и API-интерфейс, ориентированный на Python. - Хотите PagedAttention без компиляции TensorRT - Работаете с графическим процессором AMD или оборудованием, отличным от NVIDIA.

Используйте llama.cpp вместо этого, когда: - Развертывание на CPU или Apple Silicon. - Необходимо развертывание Edge-развертывание без графического процессора NVIDIA. - Хотите более простой формат квантования GGUF

Быстрый старт

Установка

# Docker (рекомендуется)
docker pull nvidia/tensorrt_llm:latest

# pip install
pip install tensorrt_llm==1.2.0rc3

# Требуется CUDA 13.0.0, TensorRT 10.13.2, Python 3.10-3.12

Базовый вывод

from tensorrt_llm import LLM, SamplingParams

# Инициализация модели
llm = LLM(model="meta-llama/Meta-Llama-3-8B")

# Настройка сэмплирования
sampling_params = SamplingParams(
    max_tokens=100,
    temperature=0.7,
    top_p=0.9
)

# Генерация
prompts = ["Объясните квантовые вычисления"]
outputs = llm.generate(prompts, sampling_params)

for output in outputs:
    print(output.text)

Обслуживание с trtllm-serve

# Запуск сервера (автоматическая загрузка и компиляция модели)
trtllm-serve meta-llama/Meta-Llama-3-8B \
    --tp_size 4 \              # Тензорный параллелизм (4 GPU)
    --max_batch_size 256 \
    --max_num_tokens 4096

# Запрос клиента
curl -X POST http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "meta-llama/Meta-Llama-3-8B",
    "messages": [{"role": "user", "content": "Привет!"}],
    "temperature": 0.7,
    "max_tokens": 100
  }'

Ключевые возможности

Оптимизация производительности

Параллелизм

Продвинутые возможности

Типовые сценарии

Квантованная модель (FP8)

from tensorrt_llm import LLM

# Загрузка FP8 квантованной модели (в 2 раза быстрее, на 50% меньше памяти)
llm = LLM(
    model="meta-llama/Meta-Llama-3-70B",
    dtype="fp8",
    max_num_tokens=8192
)

# Инференс как обычно
outputs = llm.generate(["Суммируйте эту статью..."])

Развертывание на нескольких GPU

# Тензорный параллелизм на 8 GPU
llm = LLM(
    model="meta-llama/Meta-Llama-3-405B",
    tensor_parallel_size=8,
    dtype="fp8"
)

Пакетный вывод

# Эффективная обработка 100 промптов
prompts = [f"Вопрос {i}:..." for i in range(100)]

outputs = llm.generate(
    prompts,
    sampling_params=SamplingParams(max_tokens=200)
)

# Автоматическая пакетная обработка на лету для максимальной пропускной способности

Бенчмарки производительности

Мета Лама 3-8B (графический процессор H100): - Пропускная способность: 24 000 токенов/сек - Задержка: ~10 мс по токену - По сравнению с PyTorch: в 100 раз быстрее

Лама 3-70Б (8× А100 80 ГБ): - Квантование FP8: в 2 раза быстрее FP16 - Память: снижение на 50% с FP8

Поддерживаемые модели

Ссылки

Ресурсы