本文へ移動
cccskills
無料GitHub で公開

llama-cpp

Executa inferência de LLM em CPU, Apple Silicon e GPUs consumer sem hardware NVIDIA. Use para edge deployment, Macs M1/M2/M3, GPUs AMD/Intel ou quando CUDA não está disponível. Suporta quantização GGUF (1,5-8 bits) para redução de memória e aceleração de 4-10× vs PyTorch em CPU.

インストール方法を見る

含まれるファイル(4)

  • SKILL.md6.1 KB
  • references/optimization.md1.6 KB
  • references/quantization.md4.8 KB
  • references/server.md2.2 KB

SKILL.md(原文)

インストールする前に、エージェントに与えられる指示の中身を確認できます。

llama.cpp

Inferência de LLM pura em C/C++ com dependências mínimas, otimizada para CPUs e hardware não-NVIDIA.

Quando usar llama.cpp

Use llama.cpp quando:

  • Executar em máquinas apenas com CPU
  • Fazer deploy em Apple Silicon (M1/M2/M3/M4)
  • Usar GPUs AMD ou Intel (sem CUDA)
  • Edge deployment (Raspberry Pi, sistemas embarcados)
  • Precisar de deploy simples sem Docker/Python

Use TensorRT-LLM quando:

  • Tiver GPUs NVIDIA (A100/H100)
  • Precisar de throughput máximo (100K+ tok/s)
  • Rodando em datacenter com CUDA

Use vLLM quando:

  • Tiver GPUs NVIDIA
  • Precisar de API Python-first
  • Quiser PagedAttention

Guia rápido

Instalação

# macOS/Linux
brew install llama.cpp

# Ou compilar do source
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make

# Com Metal (Apple Silicon)
make LLAMA_METAL=1

# Com CUDA (NVIDIA)
make LLAMA_CUDA=1

# Com ROCm (AMD)
make LLAMA_HIP=1

Baixar modelo

# Baixar do HuggingFace (formato GGUF)
huggingface-cli download \
    TheBloke/Llama-2-7B-Chat-GGUF \
    llama-2-7b-chat.Q4_K_M.gguf \
    --local-dir models/

# Ou converter do HuggingFace
python convert_hf_to_gguf.py models/llama-2-7b-chat/

Executar inferência

# Chat simples
./llama-cli \
    -m models/llama-2-7b-chat.Q4_K_M.gguf \
    -p "Explain quantum computing" \
    -n 256  # Max tokens

# Chat interativo
./llama-cli \
    -m models/llama-2-7b-chat.Q4_K_M.gguf \
    --interactive

Modo server

# Iniciar servidor compatível com OpenAI
./llama-server \
    -m models/llama-2-7b-chat.Q4_K_M.gguf \
    --host 0.0.0.0 \
    --port 8080 \
    -ngl 32  # Offload 32 layers to GPU

# Requisição do cliente
curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama-2-7b-chat",
    "messages": [{"role": "user", "content": "Hello!"}],
    "temperature": 0.7,
    "max_tokens": 100
  }'

Formatos de quantização

Visão geral do formato GGUF

FormatoBitsTamanho (7B)VelocidadeQualidadeCaso de Uso
Q4_K_M4,54,1 GBRápidoBomPadrão recomendado
Q4_K_S4,33,9 GBMais rápidoMenorCrítico em velocidade
Q5_K_M5,54,8 GBMédioMelhorCrítico em qualidade
Q6_K6,55,5 GBMais lentoMelhorQualidade máxima
Q8_08,07,0 GBLentoExcelenteDegradação mínima
Q2_K2,52,7 GBMais rápidoPobreApenas testes

Escolhendo quantização

# Uso geral (equilibrado)
Q4_K_M  # 4-bit, qualidade média

# Velocidade máxima (mais degradação)
Q2_K or Q3_K_M

# Qualidade máxima (mais lento)
Q6_K or Q8_0

# Modelos muito grandes (70B, 405B)
Q3_K_M or Q4_K_S  # Bits menores para caber na memória

Aceleração de hardware

Apple Silicon (Metal)

# Compilar com Metal
make LLAMA_METAL=1

# Executar com aceleração GPU (automático)
./llama-cli -m model.gguf -ngl 999  # Offload all layers

# Performance: M3 Max 40-60 tokens/sec (Llama 2-7B Q4_K_M)

GPUs NVIDIA (CUDA)

# Compilar com CUDA
make LLAMA_CUDA=1

# Offload layers para GPU
./llama-cli -m model.gguf -ngl 35  # Offload 35/40 layers

# Híbrido CPU+GPU para modelos grandes
./llama-cli -m llama-70b.Q4_K_M.gguf -ngl 20  # GPU: 20 layers, CPU: rest

GPUs AMD (ROCm)

# Compilar com ROCm
make LLAMA_HIP=1

# Executar com GPU AMD
./llama-cli -m model.gguf -ngl 999

Padrões comuns

Processamento em lote

# Processar múltiplos prompts de arquivo
cat prompts.txt | ./llama-cli \
    -m model.gguf \
    --batch-size 512 \
    -n 100

Geração restrita

# Saída JSON com grammar
./llama-cli \
    -m model.gguf \
    -p "Generate a person: " \
    --grammar-file grammars/json.gbnf

# Outputs valid JSON only

Tamanho de contexto

# Aumentar contexto (padrão 512)
./llama-cli \
    -m model.gguf \
    -c 4096  # 4K context window

# Contexto muito longo (se modelo suportar)
./llama-cli -m model.gguf -c 32768  # 32K context

Benchmarks de performance

Performance em CPU (Llama 2-7B Q4_K_M)

CPUThreadsVelocidadeCusto
Apple M3 Max1650 tok/sR$ 0 (local)
AMD Ryzen 9 7950X3235 tok/sR$ 0,50/hora
Intel i9-13900K3230 tok/sR$ 0,40/hora
AWS c7i.16xlarge6440 tok/sR$ 2,88/hora

Aceleração por GPU (Llama 2-7B Q4_K_M)

GPUVelocidadevs CPUCusto
NVIDIA RTX 4090120 tok/s3-4×R$ 0 (local)
NVIDIA A1080 tok/s2-3×R$ 1,00/hora
AMD MI25070 tok/s2×R$ 2,00/hora
Apple M3 Max (Metal)50 tok/s~MesmoR$ 0 (local)

Modelos suportados

Família LLaMA:

  • Llama 2 (7B, 13B, 70B)
  • Llama 3 (8B, 70B, 405B)
  • Code Llama

Família Mistral:

  • Mistral 7B
  • Mixtral 8x7B, 8x22B

Outros:

  • Falcon, BLOOM, GPT-J
  • Phi-3, Gemma, Qwen
  • LLaVA (vision), Whisper (audio)

Encontrar modelos: https://huggingface.co/models?library=gguf

Referências

Recursos

レビュー

まだレビューはありません。使ってみた感想をお寄せください。

同じリポジトリのスキル

概要と使いどころ

Especialista em construir experiências 3D para a web - Three.js, React Three Fiber, Spline, WebGL e cenas 3D interativas. Cobre configuradores de produtos, portfólios 3D, websites imersivos e adição de profundidade às experiências web. Use quando: website 3D, three.js, WebGL, react three fiber, experiência 3D.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Quando o usuário quer planejar, projetar ou implementar um teste A/B ou experimento. Também use quando o usuário menciona "teste A/B", "split test", "experimento", "testar essa mudança", "copy variante", "teste multivariado" ou "hipótese". Para implementação de rastreamento, veja analytics-tracking.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Auditar e melhorar a acessibilidade web seguindo as diretrizes WCAG 2.1. Use quando solicitado para "melhorar acessibilidade", "auditoria a11y", "conformidade WCAG", "suporte a leitor de tela", "navegação por teclado" ou "tornar acessível".

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Testes e benchmarking de agentes LLM incluindo testes comportamentais, avaliação de capacidades, métricas de confiabilidade e monitoramento em produção—onde até os melhores agentes alcançam menos de 50% em benchmarks do mundo real. Use quando: testes de agentes, avaliação de agentes, benchmark de agentes, confiabilidade de agentes, teste de agentes.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Criar, gerenciar e orquestrar agentes de IA usando o CLI AI Maestro. Use quando o usuário pedir para "criar agente", "listar agentes", "deletar agente", "hibernar agente", "despertar agente", "instalar plugin", "mostrar agente", "reiniciar agente" ou qualquer tarefa de gerenciamento do ciclo de vida do agente.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Gerencie múltiplos agentes CLI locais via sessões tmux (iniciar/parar/monitorar/atribuir) com agendamento compatível com cron.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

artubss のスキルをすべて見る

このスキルの問題を報告する