Kira Doctor
Kira Doctor29/04/2026 19:43
Compartilhe

Evals para agent skills: teste agentes com método

    TL;DR

    Quando um agente começa a usar ferramentas, encadear passos e tomar decisões, testar só a resposta final deixa de ser suficiente. A forma mais útil de medir qualidade é decompor a habilidade em dataset, rubrica, scoring e avaliação de trajetória.

    Isso muda o trabalho do time: eval deixa de ser um checklist informal e vira engenharia de testes para agentes. O ganho prático é conseguir comparar versões, achar regressões cedo e saber se o problema está no raciocínio, no uso de ferramenta ou no formato da saída.

    O que são “agent skills” na prática

    “Skill” aqui não é um conceito abstrato. É uma capacidade observável do agente: classificar uma solicitação, buscar dados, usar uma ferramenta na ordem certa, manter contexto em múltiplos turns, ou concluir uma tarefa sem quebrar restrições.

    O ponto central do material de referência é simples: se a skill é importante para o produto, ela precisa virar algo testável. Em vez de perguntar “o agente parece bom?”, você pergunta “quais casos exercitam essa habilidade, qual é o critério de sucesso e como agregamos o resultado?”.

    Esse corte é especialmente útil em agentes que fazem mais do que gerar texto. A partir do momento em que há tool-use, memória de curto prazo, caminhos alternativos e múltiplas etapas, a avaliação precisa olhar para o processo, não apenas para o último parágrafo.

    Do produto ao teste: skill → dataset → grader → score

    O fluxo recomendado nos guias de evals para agentes começa na definição da habilidade. Depois vem a montagem de um conjunto de entradas representativas, com casos fáceis, intermediários e ambíguos. Só então entram os graders, que avaliam se o comportamento esperado aconteceu.

    Na prática, isso costuma virar quatro camadas:

    • Dataset: exemplos que representam a skill em condições reais.
    • Rubrica: critérios objetivos ou semiestruturados para julgar sucesso.
    • Grader: checagem determinística, LLM-judge ou híbrida.
    • Score agregado: média, taxa de sucesso, distribuição por categoria e regressão por versão.

    Um detalhe importante é evitar escolher só exemplos “bonitos”. Para agentes, o dataset precisa cobrir variações que aparecem em produção: linguagem informal, pedido incompleto, instruções conflitantes, quebra de expectativa e mudanças de contexto ao longo da conversa.

    Exemplo de estrutura de caso

    Se a skill é “consultar uma base interna e responder com fonte”, o teste não deve medir apenas a resposta final. Ele precisa verificar se o agente realmente consultou a fonte certa, se não misturou IDs e se preservou a restrição de citar apenas o que está no material recuperado.

    undefined
    

    O valor desse formato é que ele separa intenção de implementação. Se uma versão nova do agente passar a responder com boa redação, mas parar de usar a ferramenta, o eval captura a regressão imediatamente.

    Graders: quando usar regra fixa e quando usar LLM-judge

    Nem toda habilidade precisa de julgamento por modelo. Sempre que der para validar com regra fixa, vale preferir isso: matches estruturados, presença de campo, ordem de passos, checagem de schema e comparação com resposta esperada. Isso reduz custo e aumenta repetibilidade.

    Já a LLM-as-judge entra quando a avaliação depende de qualidade semântica, cobertura parcial ou julgamento mais flexível. É o caso de resumir, priorizar, explicar, negociar trade-offs ou decidir se a trajetória do agente foi aceitável mesmo sem seguir um roteiro único.

    O cuidado aqui é tratar o judge como parte do sistema de teste, não como oráculo. É bom calibrar a rubrica com exemplos ancorados, rodar amostras revisadas por humano e medir concordância antes de usar o score como métrica principal.

    Para agentes multi-turn, o julgamento tende a ficar mais próximo de um parecer sobre efeito e consistência. Em vez de perguntar apenas “o texto final está certo?”, você pergunta “a sequência de ações preservou o objetivo, respeitou restrições e produziu o efeito esperado?”.

    Avaliação por trajetória: o que o output final esconde

    Em agentes, a trajetória importa. Dois outputs iguais podem vir de caminhos totalmente diferentes, e um caminho errado pode passar despercebido se a resposta final parecer aceitável. Por isso, eval moderno para agente precisa registrar turns, ferramentas chamadas, ordem das decisões e mudanças de estado.

    Essa visão por trajetória ajuda a detectar três classes de problema: o agente que não sabe começar, o agente que até começa certo mas se perde no meio, e o agente que produz a resposta correta por coincidência. Em produção, esses perfis levam a falhas bem diferentes.

    Um exemplo comum é o agente que consulta uma API certa, mas ignora o JSON retornado na etapa seguinte e inventa o preenchimento final. Outro é o agente que resolve a tarefa, só que usa uma ferramenta proibida no caminho. Sem rastreamento, ambos podem parecer “bons” olhando apenas o fim.

    O que acompanhar no trace

    • sequência de turns e tool calls;
    • mudanças de estado relevantes;
    • tempo por etapa;
    • erros recuperáveis e não recuperáveis;
    • custo por execução;
    • pontos de abandono ou loop.

    Esse nível de observabilidade aproxima evals de teste de software clássico. Mudou a versão do agente, do prompt ou da ferramenta, você quer saber exatamente qual etapa do fluxo degradou. Sem esse recorte, toda análise vira tentativa e erro.

    Como montar um ciclo de melhoria contínua

    O jeito mais útil de operar skill evals é em ciclo curto. Primeiro, definir a skill crítica para o produto. Depois, escrever casos representativos, escolher a rubrica, rodar baseline e comparar versões novas antes de liberar qualquer mudança sensível.

    Um bom hábito é separar métricas por categoria. Em vez de um único número, acompanhe sucesso geral, casos ambíguos, falhas por ferramenta, custo médio e latência. Isso evita decisões ruins guiadas por uma média que esconde regressões em cenários importantes.

    Também vale criar uma rotina de triagem. Quando um caso falha, o time precisa responder rapidamente se o problema é prompt, ferramenta, dado, política ou limitação do modelo. Essa classificação torna a correção mais objetiva e ajuda a priorizar o que realmente impacta o produto.

    Benchmarks como AgentBench servem de referência para pensar cobertura. Eles lembram que agentes vivem em ambientes diferentes e que uma skill só está bem testada quando resiste a variações, não apenas a um cenário idealizado.

    Por que isso importa pro dev brasileiro

    No Brasil, a pressão por custo e previsibilidade pesa mais porque muita operação é orçada em BRL, com câmbio e subida de custos em dólar no meio da conta. Se um agente consome tokens demais ou faz chamadas desnecessárias, a diferença aparece rápido no orçamento do time.

    Tem também um ponto regulatório bem concreto: LGPD e exigências de retenção, minimização e tratamento adequado de dados pessoais. Em agentes que consultam suporte, RH, saúde ou finanças, skill eval precisa incluir casos que testem vazamento de PII, uso indevido de contexto e respostas que extrapolam a base permitida.

    Na prática brasileira, isso conversa com o dia a dia de times que misturam cloud global, latência para us-east-1 e produtos com alto volume de atendimento. Um agente que funciona no laboratório, mas fica caro, lento ou inseguro em produção, costuma falhar justamente onde o impacto financeiro e jurídico é maior.

    Um roteiro enxuto para começar na sua base

    Se você quer sair do conceito e ir para a implementação, comece pequeno. Escolha uma habilidade crítica, escreva de 20 a 50 casos que representem o trabalho real e defina um critério binário de sucesso antes de sofisticar o restante.

    1. Liste a skill mais valiosa do agente.
    2. Quebre a skill em comportamentos observáveis.
    3. Escreva casos com variação realista.
    4. Defina o que é sucesso e o que é falha.
    5. Rode a baseline e salve o trace.
    6. Reavalie toda mudança relevante antes de publicar.

    Se o seu agente usa ferramentas, registre também quais chamadas seriam aceitáveis, quais são opcionais e quais são proibidas. Essa camada evita muitos falsos positivos e deixa a comparação entre versões menos subjetiva.

    Conclusão

    Evals para agent skills são a forma mais prática de transformar comportamento de agente em processo de teste confiável. Quando você mede trajetória, rubrica e score agregado, a conversa deixa de ser “parece funcionar” e vira “passou nos casos que importam”.

    Para aplicar isso hoje, escolha uma skill do seu agente, escreva 20 casos reais e rode uma avaliação simples com regra fixa ou judge calibrado. Em até 1 hora, você já consegue montar um baseline útil e descobrir onde o agente realmente quebra.

    Conteúdos da DIO para quem quer aprofundar

    Compartilhe
    Recomendados para você
    Microsoft Certification Challenge #5 - AI 102
    Bradesco - GenAI & Dados
    GitHub Copilot - Código na Prática
    Comentários (0)