Evals para agent skills: testes reprodutíveis e comparáveis
TL;DR
Evals para agent skills funcionam melhor quando viram um pipeline fixo: “entrada → execução do agente com/sem skills → captura de traço/artefatos → checks → score”. Isso permite comparar versões ao longo do tempo e medir o ganho real trazido pelas skills, reduzindo regressões e ruído do julgamento.
O que significa avaliar “agent skills” do jeito certo
Quando você instrumenta um agente para usar skills específicas (ferramentas, rotinas, funções ou módulos), o comportamento fica mais “sistêmico” do que uma simples resposta. O lugar natural da avaliação deixa de ser só o outcome final e passa a incluir aspectos da trajetória (como o agente decide e executa etapas) e da evidência (quais artefatos/outputs intermediários foram produzidos).
O ponto de convergência nas metodologias recentes é modelar evals como unidades testáveis: você roda o agente sob um conjunto de condições, captura rastros/artefatos e aplica checks que geram um score comparável. Essa abordagem é descrita em detalhes na visão operacional da OpenAI para avaliação de skills (run + trace/artefatos + checks → score) e também aparece na ênfase de olhar para processo/trajectória ao avaliar agentes no nível de sistema.
Arquitetura do pipeline de eval (harness) — do run ao score
Um harness de eval bem definido reduz “ambiguidade operacional”: todo teste passa a ter a mesma estrutura, o que facilita regressão e debugging. A estrutura típica fica assim:
- Estímulo (stimulus/input): prompt/estado inicial e contexto.
- Condição: agente rodando com skills específicas, ou com baseline “sem skills”, ou com um conjunto “curated/selecionado”.
- Execução e captura: registrar trace (passos, seleções, chamadas) e artefatos (arquivos gerados, trechos produzidos, resultados intermediários).
- Checks: validações determinísticas quando possível; quando não, rubricas controladas.
- Score e agregação: produzir métricas por verificador/tarefa e permitir comparação entre versões.
Checagens determinísticas vs rubricas: quando usar cada uma
Se a habilidade produzir algo verificável por regra (por exemplo, “o agente deve chamar uma skill X em determinada etapa”, “o resultado deve satisfazer um critério verificável”, “um verificador binário passa/falha”), use verificadores determinísticos para reduzir ruído e aumentar reprodutibilidade. Esse tipo de abordagem é central no benchmark SkillsBench, que emparelha tarefas com verifiers determinísticos para diminuir dependência de julgamento por modelo.
Se não houver um critério determinístico confiável, rubricas (documentadas) ajudam a reduzir divergência: elas precisam ser estáveis, com critérios observáveis e, idealmente, executadas de forma consistente. A ideia aqui é que a rubrica seja mais “contrato” do que “opinião”.
Baseline “sem skills” e desenho experimental para medir ganho
Um erro comum em evals de agent skills é confundir “o agente respondeu alguma coisa” com “as skills ajudaram”. Para medir contribuição real, você precisa de condições comparáveis. O desenho experimental mais instrutivo trata a avaliação como um experimento com:
- Sem skills (baseline): agente sem as skills sob teste.
- Com skills curadas/selecionadas: conjunto definido que representa o “uso correto” das skills.
- Outras condições (quando fizer sentido): por exemplo, skills auto-geradas ou variações controladas.
Esse enfoque é explicitado no SkillsBench: as condições permitem estimar o “incremento de habilidade” causado pelas skills, ao invés de apenas medir outcome bruto.
Como isso vira uma métrica prática
Na prática, você quer computar deltas comparáveis, como:
- Scorecom skills − Scoresem skills
- Taxa de pass/fail por verificador em cada condição
- Distribuição de falhas por etapa (quando o trace está disponível)
O valor disso aparece especialmente quando você começa a versionar mudanças (prompt, roteamento, tool specs, políticas de uso de skills) e quer identificar regressões rapidamente.
Olhar para a trajetória: reduzindo “black-boxing”
Mesmo com score final, agentes podem falhar por motivos diferentes (ex.: usar skill errada, chamar a ordem incorreta, não coletar dados necessários na etapa anterior). Por isso, avaliações úteis combinam métricas de trajetória/processo (sinal intermediário) com checagens de outcome.
A perspectiva apresentada na engenharia da Anthropic para “demystifying evals” ressalta que agentes são sistemas e que avaliações precisam lidar com a complexidade da trajetória. Tradução direta: seus checks precisam conseguir capturar evidência suficiente do processo para explicar o score, não apenas computá-lo.
Exemplo conceitual de harness (pseudoestrutura executável)
Mesmo que você não implemente em uma linguagem específica, pense no harness como um “pipeline determinístico” na forma de dados: inputs e configurações versionados + outputs rastreados + checks plugáveis.
Esta seção descreve um padrão de implementação; ajuste nomes de eventos/artefatos de acordo com seu framework de execução e trace.
undefined
Ângulo brasileiro: por que “reprodutibilidade” importa na prática (LGPD e rastreio)
No Brasil, avaliações de agentes costumam envolver prompts com dados operacionais (ex.: tickets, contratos, e-mails internos). Isso ativa uma obrigação prática: garantir que o material coletado para trace/artefatos respeite a LGPD (dados pessoais, finalidade, retenção e base legal). Na prática, um harness que salva trace e artefatos precisa ter passos concretos: redigir/anonimizar campos, limitar retenção e classificar quais artefatos podem ser persistidos para auditoria.
Além disso, clusters e pipelines de CI/CD no Brasil muitas vezes priorizam latência e previsibilidade de custo. Ao desenhar seu eval harness, você ganha quando consegue rodar verificadores determinísticos (menos ciclos, menos custo com julgamentos por modelo) e quando as execuções são registradas com metadados que explicam variações.
Checklist de implementação para sistematizar testes de agent skills
1) Versione o que muda
Trate como versão: prompt, tool specs, lista de skills habilitadas, roteamento e parâmetros do modelo (quando possível). E versione também o próprio conjunto de casos de teste (inputs) e checks.
2) Faça o trace “debugável”
Se um caso falhar, você precisa saber: qual skill foi escolhida, por quê (quando houver sinal), quais chamadas ocorreram e quais artefatos foram produzidos. Sem isso, score vira ruído.
3) Preferir verificação binária quando há prova estrutural
Se o verificador pode ser determinístico (ex.: validação de estrutura, presença de campos, execução de tool em ordem), use pass/fail. O SkillsBench é um exemplo de como verificar tarefas com verifiers determinísticos para reduzir ruído.
4) Use rubricas com critérios observáveis
Quando depender de rubrica, documente os critérios e mantenha estabilidade do processo. Se sua rubrica depende de modelo como juiz, reduza variância (por exemplo, padronizando o texto de julgamento e limites de contexto utilizados pelo juiz).
5) Relatórios por caso e por etapa
Agregue score, mas sempre permita drill-down por tarefa e por check. A falha recorrente deve apontar para um tipo de etapa (planejamento, recuperação, execução de skill, síntese).
Fontes e referências para o desenho do seu harness
- Testing Agent Skills Systematically with Evals (OpenAI Developers)
- Demystifying evals for AI agents (Anthropic Engineering)
- SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks (arXiv:2602.12670)
- benchflow-ai/skillsbench (implementação do benchmark)
- hamelsmu/evals-skills (repositório com skills voltadas a apoiar pipelines de avaliação)
Conclusão e próximos passos
Para sistematizar testes de agent skills, você precisa transformar avaliação em um pipeline comparável: baseline “sem skills”, execução com/sem skills, captura de trace/artefatos, checks (preferencialmente determinísticos) e score. Isso reduz regressões e torna a contribuição das skills mensurável como delta real, não como impressão.
CTA (em até 1 hora): abra o repositório do SkillsBench e copie o esqueleto de “tarefa + verificador” para montar 3 casos do seu domínio (1 baseline sem skills e 1 com skills curadas), garantindo que o check possa rodar determinístico e produza pass/fail.
Conteúdos da DIO para quem quer aprofundar
- Aceleração Microsoft AI Agents — trilha prática com workshops sobre construção e gerenciamento de agentes e ferramentas de IA, incluindo uso de Azure IA Foundry.



