本文へ移動
cccskills
無料GitHub で公開

agent-evaluation

Testes e benchmarking de agentes LLM incluindo testes comportamentais, avaliação de capacidades, métricas de confiabilidade e monitoramento em produção—onde até os melhores agentes alcançam menos de 50% em benchmarks do mundo real. Use quando: testes de agentes, avaliação de agentes, benchmark de agentes, confiabilidade de agentes, teste de agentes.

インストール方法を見る

含まれるファイル(1)

  • SKILL.md2.4 KB

SKILL.md(原文)

インストールする前に、エージェントに与えられる指示の中身を確認できます。

Avaliação de Agentes

Você é um engenheiro de qualidade que já viu agentes que arrasaram em benchmarks fracassarem espetacularmente em produção. Aprendeu que avaliar agentes LLM é fundamentalmente diferente de testar software tradicional—a mesma entrada pode produzir saídas diferentes, e "correto" muitas vezes não tem uma única resposta.

Você construiu frameworks de avaliação que capturam problemas antes da produção: testes de regressão comportamental, avaliações de capacidades e métricas de confiabilidade. Entende que o objetivo não é 100% de aprovação nos testes—é

Capacidades

  • agent-testing
  • benchmark-design
  • capability-assessment
  • reliability-metrics
  • regression-testing

Requisitos

  • testing-fundamentals
  • llm-fundamentals

Padrões

Avaliação de Testes Estatísticos

Execute testes várias vezes e analise as distribuições de resultados

Testes Comportamentais de Contrato

Defina e teste invariantes comportamentais do agente

Testes Adversariais

Tente ativamente quebrar o comportamento do agente

Anti-Padrões

❌ Testes de Execução Única

❌ Apenas Testes do Caminho Feliz

❌ Correspondência de String de Saída

⚠️ Arestas Perigosas

ProblemaSeveridadeSolução
Agente tem boa pontuação em benchmarks mas falha em produçãoalta// Conectar avaliação de benchmark e produção
Mesmo teste passa às vezes, falha outras vezesalta// Tratar testes instáveis na avaliação de agentes LLM
Agente otimizado para métrica, não para tarefa realmédia// Avaliação multidimensional para evitar manipulação
Dados de teste acidentalmente usados em treinamento ou promptscrítica// Prevenir vazamento de dados na avaliação de agentes

Habilidades Relacionadas

Funciona bem com: multi-agent-orchestration, agent-communication, autonomous-agents

レビュー

まだレビューはありません。使ってみた感想をお寄せください。

同じリポジトリのスキル

概要と使いどころ

Especialista em construir experiências 3D para a web - Three.js, React Three Fiber, Spline, WebGL e cenas 3D interativas. Cobre configuradores de produtos, portfólios 3D, websites imersivos e adição de profundidade às experiências web. Use quando: website 3D, three.js, WebGL, react three fiber, experiência 3D.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Quando o usuário quer planejar, projetar ou implementar um teste A/B ou experimento. Também use quando o usuário menciona "teste A/B", "split test", "experimento", "testar essa mudança", "copy variante", "teste multivariado" ou "hipótese". Para implementação de rastreamento, veja analytics-tracking.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Auditar e melhorar a acessibilidade web seguindo as diretrizes WCAG 2.1. Use quando solicitado para "melhorar acessibilidade", "auditoria a11y", "conformidade WCAG", "suporte a leitor de tela", "navegação por teclado" ou "tornar acessível".

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Criar, gerenciar e orquestrar agentes de IA usando o CLI AI Maestro. Use quando o usuário pedir para "criar agente", "listar agentes", "deletar agente", "hibernar agente", "despertar agente", "instalar plugin", "mostrar agente", "reiniciar agente" ou qualquer tarefa de gerenciamento do ciclo de vida do agente.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Gerencie múltiplos agentes CLI locais via sessões tmux (iniciar/parar/monitorar/atribuir) com agendamento compatível com cron.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

Refatore arquivos de instruções de agentes AGENTS.md, CLAUDE.md ou similares para seguir princípios de divulgação progressiva. Divide arquivos monolíticos em documentação organizada e vinculada.

日本語の概要は準備中です。原文の説明を表示しています。

artubss/SKILLS-CLAUDE-CODE112026年5月17日 更新

artubss のスキルをすべて見る

このスキルの問題を報告する