本文へ移動
cccskills
無料GitHub で公開

tensorrt-llm

Otimiza inferência de LLM com NVIDIA TensorRT para máxima vazão e latência mínima. Use para implantação em produção em GPUs NVIDIA (A100/H100), quando você precisa de inferência 10-100x mais rápida que PyTorch, ou para servir modelos com quantização (FP8/INT4), batching em voo e escalabilidade multi-GPU.

インストール方法を見る

含まれるファイル(4)

  • SKILL.md5.1 KB
  • references/multi-gpu.md6.5 KB
  • references/optimization.md5.5 KB
  • references/serving.md9.6 KB

SKILL.md(原文)

インストールする前に、エージェントに与えられる指示の中身を確認できます。

TensorRT-LLM

Biblioteca open-source da NVIDIA para otimizar inferência de LLM com performance de ponta em GPUs NVIDIA.

Quando usar TensorRT-LLM

Use TensorRT-LLM quando:

  • Implantar em GPUs NVIDIA (A100, H100, GB200)
  • Precisar de máxima vazão (24.000+ tokens/seg em Llama 3)
  • Exigir baixa latência para aplicações em tempo real
  • Trabalhar com modelos quantizados (FP8, INT4, FP4)
  • Escalar entre múltiplas GPUs ou nós

Use vLLM em vez disso quando:

  • Precisar de configuração mais simples e API Python-first
  • Quiser PagedAttention sem compilação TensorRT
  • Trabalhar com GPUs AMD ou hardware não-NVIDIA

Use llama.cpp em vez disso quando:

  • Implantar em CPU ou Apple Silicon
  • Precisar de edge deployment sem GPUs NVIDIA
  • Quiser formato de quantização GGUF mais simples

Início rápido

Instalação

# Docker (recomendado)
docker pull nvidia/tensorrt_llm:latest

# pip install
pip install tensorrt_llm==1.2.0rc3

# Requer CUDA 13.0.0, TensorRT 10.13.2, Python 3.10-3.12

Inferência básica

from tensorrt_llm import LLM, SamplingParams

# Inicializar modelo
llm = LLM(model="meta-llama/Meta-Llama-3-8B")

# Configurar sampling
sampling_params = SamplingParams(
    max_tokens=100,
    temperature=0.7,
    top_p=0.9
)

# Gerar
prompts = ["Explain quantum computing"]
outputs = llm.generate(prompts, sampling_params)

for output in outputs:
    print(output.text)

Servindo com trtllm-serve

# Iniciar servidor (download automático e compilação do modelo)
trtllm-serve meta-llama/Meta-Llama-3-8B \
    --tp_size 4 \              # Tensor parallelism (4 GPUs)
    --max_batch_size 256 \
    --max_num_tokens 4096

# Requisição do cliente
curl -X POST http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "meta-llama/Meta-Llama-3-8B",
    "messages": [{"role": "user", "content": "Hello!"}],
    "temperature": 0.7,
    "max_tokens": 100
  }'

Recursos-chave

Otimizações de performance

  • In-flight batching: Batching dinâmico durante geração
  • Paged KV cache: Gestão eficiente de memória
  • Flash Attention: Kernels de atenção otimizados
  • Quantização: FP8, INT4, FP4 para inferência 2-4× mais rápida
  • CUDA graphs: Overhead reduzido de kernel launch

Paralelismo

  • Tensor parallelism (TP): Dividir modelo entre GPUs
  • Pipeline parallelism (PP): Distribuição por camadas
  • Expert parallelism: Para modelos Mixture-of-Experts
  • Multi-node: Escalar além de uma única máquina

Recursos avançados

  • Speculative decoding: Geração mais rápida com modelos draft
  • LoRA serving: Deploy multi-adapter eficiente
  • Disaggregated serving: Separar prefill e geração

Padrões comuns

Modelo quantizado (FP8)

from tensorrt_llm import LLM

# Carregar modelo quantizado FP8 (2× mais rápido, 50% menos memória)
llm = LLM(
    model="meta-llama/Meta-Llama-3-70B",
    dtype="fp8",
    max_num_tokens=8192
)

# Inferência igual a antes
outputs = llm.generate(["Summarize this article..."])

Deploy multi-GPU

# Tensor parallelism em 8 GPUs
llm = LLM(
    model="meta-llama/Meta-Llama-3-405B",
    tensor_parallel_size=8,
    dtype="fp8"
)

Inferência em batch

# Processar 100 prompts eficientemente
prompts = [f"Question {i}: ..." for i in range(100)]

outputs = llm.generate(
    prompts,
    sampling_params=SamplingParams(max_tokens=200)
)

# Batching automático em voo para máxima vazão

Benchmarks de performance

Meta Llama 3-8B (GPU H100):

  • Vazão: 24.000 tokens/seg
  • Latência: ~10ms por token
  • vs PyTorch: 100× mais rápido

Llama 3-70B (8× A100 80GB):

  • Quantização FP8: 2× mais rápido que FP16
  • Memória: 50% redução com FP8

Modelos suportados

  • Família LLaMA: Llama 2, Llama 3, CodeLlama
  • Família GPT: GPT-2, GPT-J, GPT-NeoX
  • Qwen: Qwen, Qwen2, QwQ
  • DeepSeek: DeepSeek-V2, DeepSeek-V3
  • Mixtral: Mixtral-8x7B, Mixtral-8x22B
  • Vision: LLaVA, Phi-3-vision
  • 100+ modelos no HuggingFace

Referências

Recursos

レビュー

まだレビューはありません。使ってみた感想をお寄せください。

同じリポジトリのスキル

概要と使いどころ

Especialista em construir experiências 3D para a web - Three.js, React Three Fiber, Spline, WebGL e cenas 3D interativas. Cobre configuradores de produtos, portfólios 3D, websites imersivos e adição de profundidade às experiências web. Use quando: website 3D, three.js, WebGL, react three fiber, experiência 3D.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Quando o usuário quer planejar, projetar ou implementar um teste A/B ou experimento. Também use quando o usuário menciona "teste A/B", "split test", "experimento", "testar essa mudança", "copy variante", "teste multivariado" ou "hipótese". Para implementação de rastreamento, veja analytics-tracking.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Auditar e melhorar a acessibilidade web seguindo as diretrizes WCAG 2.1. Use quando solicitado para "melhorar acessibilidade", "auditoria a11y", "conformidade WCAG", "suporte a leitor de tela", "navegação por teclado" ou "tornar acessível".

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Testes e benchmarking de agentes LLM incluindo testes comportamentais, avaliação de capacidades, métricas de confiabilidade e monitoramento em produção—onde até os melhores agentes alcançam menos de 50% em benchmarks do mundo real. Use quando: testes de agentes, avaliação de agentes, benchmark de agentes, confiabilidade de agentes, teste de agentes.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Criar, gerenciar e orquestrar agentes de IA usando o CLI AI Maestro. Use quando o usuário pedir para "criar agente", "listar agentes", "deletar agente", "hibernar agente", "despertar agente", "instalar plugin", "mostrar agente", "reiniciar agente" ou qualquer tarefa de gerenciamento do ciclo de vida do agente.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Gerencie múltiplos agentes CLI locais via sessões tmux (iniciar/parar/monitorar/atribuir) com agendamento compatível com cron.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

artubss のスキルをすべて見る

このスキルの問題を報告する