Kira Doctor
Kira Doctor27/04/2026 17:00
Compartilhe

Evals para agent skills: testes reprodutíveis e comparáveis

    TL;DR

    Evals para agent skills funcionam melhor quando viram um pipeline fixo: “entrada → execução do agente com/sem skills → captura de traço/artefatos → checks → score”. Isso permite comparar versões ao longo do tempo e medir o ganho real trazido pelas skills, reduzindo regressões e ruído do julgamento.

    O que significa avaliar “agent skills” do jeito certo

    Quando você instrumenta um agente para usar skills específicas (ferramentas, rotinas, funções ou módulos), o comportamento fica mais “sistêmico” do que uma simples resposta. O lugar natural da avaliação deixa de ser só o outcome final e passa a incluir aspectos da trajetória (como o agente decide e executa etapas) e da evidência (quais artefatos/outputs intermediários foram produzidos).

    O ponto de convergência nas metodologias recentes é modelar evals como unidades testáveis: você roda o agente sob um conjunto de condições, captura rastros/artefatos e aplica checks que geram um score comparável. Essa abordagem é descrita em detalhes na visão operacional da OpenAI para avaliação de skills (run + trace/artefatos + checks → score) e também aparece na ênfase de olhar para processo/trajectória ao avaliar agentes no nível de sistema.

    Arquitetura do pipeline de eval (harness) — do run ao score

    Um harness de eval bem definido reduz “ambiguidade operacional”: todo teste passa a ter a mesma estrutura, o que facilita regressão e debugging. A estrutura típica fica assim:

    • Estímulo (stimulus/input): prompt/estado inicial e contexto.
    • Condição: agente rodando com skills específicas, ou com baseline “sem skills”, ou com um conjunto “curated/selecionado”.
    • Execução e captura: registrar trace (passos, seleções, chamadas) e artefatos (arquivos gerados, trechos produzidos, resultados intermediários).
    • Checks: validações determinísticas quando possível; quando não, rubricas controladas.
    • Score e agregação: produzir métricas por verificador/tarefa e permitir comparação entre versões.

    Checagens determinísticas vs rubricas: quando usar cada uma

    Se a habilidade produzir algo verificável por regra (por exemplo, “o agente deve chamar uma skill X em determinada etapa”, “o resultado deve satisfazer um critério verificável”, “um verificador binário passa/falha”), use verificadores determinísticos para reduzir ruído e aumentar reprodutibilidade. Esse tipo de abordagem é central no benchmark SkillsBench, que emparelha tarefas com verifiers determinísticos para diminuir dependência de julgamento por modelo.

    Se não houver um critério determinístico confiável, rubricas (documentadas) ajudam a reduzir divergência: elas precisam ser estáveis, com critérios observáveis e, idealmente, executadas de forma consistente. A ideia aqui é que a rubrica seja mais “contrato” do que “opinião”.

    Baseline “sem skills” e desenho experimental para medir ganho

    Um erro comum em evals de agent skills é confundir “o agente respondeu alguma coisa” com “as skills ajudaram”. Para medir contribuição real, você precisa de condições comparáveis. O desenho experimental mais instrutivo trata a avaliação como um experimento com:

    • Sem skills (baseline): agente sem as skills sob teste.
    • Com skills curadas/selecionadas: conjunto definido que representa o “uso correto” das skills.
    • Outras condições (quando fizer sentido): por exemplo, skills auto-geradas ou variações controladas.

    Esse enfoque é explicitado no SkillsBench: as condições permitem estimar o “incremento de habilidade” causado pelas skills, ao invés de apenas medir outcome bruto.

    Como isso vira uma métrica prática

    Na prática, você quer computar deltas comparáveis, como:

    • Scorecom skills − Scoresem skills
    • Taxa de pass/fail por verificador em cada condição
    • Distribuição de falhas por etapa (quando o trace está disponível)

    O valor disso aparece especialmente quando você começa a versionar mudanças (prompt, roteamento, tool specs, políticas de uso de skills) e quer identificar regressões rapidamente.

    Olhar para a trajetória: reduzindo “black-boxing”

    Mesmo com score final, agentes podem falhar por motivos diferentes (ex.: usar skill errada, chamar a ordem incorreta, não coletar dados necessários na etapa anterior). Por isso, avaliações úteis combinam métricas de trajetória/processo (sinal intermediário) com checagens de outcome.

    A perspectiva apresentada na engenharia da Anthropic para “demystifying evals” ressalta que agentes são sistemas e que avaliações precisam lidar com a complexidade da trajetória. Tradução direta: seus checks precisam conseguir capturar evidência suficiente do processo para explicar o score, não apenas computá-lo.

    Exemplo conceitual de harness (pseudoestrutura executável)

    Mesmo que você não implemente em uma linguagem específica, pense no harness como um “pipeline determinístico” na forma de dados: inputs e configurações versionados + outputs rastreados + checks plugáveis.

    Esta seção descreve um padrão de implementação; ajuste nomes de eventos/artefatos de acordo com seu framework de execução e trace.
    undefined
    

    Ângulo brasileiro: por que “reprodutibilidade” importa na prática (LGPD e rastreio)

    No Brasil, avaliações de agentes costumam envolver prompts com dados operacionais (ex.: tickets, contratos, e-mails internos). Isso ativa uma obrigação prática: garantir que o material coletado para trace/artefatos respeite a LGPD (dados pessoais, finalidade, retenção e base legal). Na prática, um harness que salva trace e artefatos precisa ter passos concretos: redigir/anonimizar campos, limitar retenção e classificar quais artefatos podem ser persistidos para auditoria.

    Além disso, clusters e pipelines de CI/CD no Brasil muitas vezes priorizam latência e previsibilidade de custo. Ao desenhar seu eval harness, você ganha quando consegue rodar verificadores determinísticos (menos ciclos, menos custo com julgamentos por modelo) e quando as execuções são registradas com metadados que explicam variações.

    Checklist de implementação para sistematizar testes de agent skills

    1) Versione o que muda

    Trate como versão: prompt, tool specs, lista de skills habilitadas, roteamento e parâmetros do modelo (quando possível). E versione também o próprio conjunto de casos de teste (inputs) e checks.

    2) Faça o trace “debugável”

    Se um caso falhar, você precisa saber: qual skill foi escolhida, por quê (quando houver sinal), quais chamadas ocorreram e quais artefatos foram produzidos. Sem isso, score vira ruído.

    3) Preferir verificação binária quando há prova estrutural

    Se o verificador pode ser determinístico (ex.: validação de estrutura, presença de campos, execução de tool em ordem), use pass/fail. O SkillsBench é um exemplo de como verificar tarefas com verifiers determinísticos para reduzir ruído.

    4) Use rubricas com critérios observáveis

    Quando depender de rubrica, documente os critérios e mantenha estabilidade do processo. Se sua rubrica depende de modelo como juiz, reduza variância (por exemplo, padronizando o texto de julgamento e limites de contexto utilizados pelo juiz).

    5) Relatórios por caso e por etapa

    Agregue score, mas sempre permita drill-down por tarefa e por check. A falha recorrente deve apontar para um tipo de etapa (planejamento, recuperação, execução de skill, síntese).

    Fontes e referências para o desenho do seu harness

    Conclusão e próximos passos

    Para sistematizar testes de agent skills, você precisa transformar avaliação em um pipeline comparável: baseline “sem skills”, execução com/sem skills, captura de trace/artefatos, checks (preferencialmente determinísticos) e score. Isso reduz regressões e torna a contribuição das skills mensurável como delta real, não como impressão.

    CTA (em até 1 hora): abra o repositório do SkillsBench e copie o esqueleto de “tarefa + verificador” para montar 3 casos do seu domínio (1 baseline sem skills e 1 com skills curadas), garantindo que o check possa rodar determinístico e produza pass/fail.

    Conteúdos da DIO para quem quer aprofundar

    • Aceleração Microsoft AI Agents — trilha prática com workshops sobre construção e gerenciamento de agentes e ferramentas de IA, incluindo uso de Azure IA Foundry.
    Compartilhe
    Recomendados para você
    Microsoft Certification Challenge #5 - AI 102
    Bradesco - GenAI & Dados
    GitHub Copilot - Código na Prática
    Comentários (0)