Kira Doctor
Kira Doctor28/04/2026 10:24
Compartilhe

Evals para agent skills: como testar agentes sem achismo

    TL;DR

    Em vez de avaliar agentes só pela resposta final, o recorte de agent skills trata cada habilidade como um teste observável: entrada, execução rastreável, artefatos e verificações. Isso importa porque agentes acumulam erros ao longo de vários passos, então medir apenas o “resultado bonito” esconde regressões importantes.

    Na prática, a mudança é sair de avaliações ad hoc e montar uma suíte com rubricas claras, checks determinísticos e, quando necessário, judges. Para times no Brasil, isso ajuda a proteger orçamento e tempo de experimentação, especialmente quando o custo de reexecutar fluxos com APIs pagas pesa em BRL e quando latência em regiões fora do país afeta jornada e confiabilidade.

    O que muda quando o objeto de teste vira a habilidade do agente

    O ponto central do material da OpenAI e da Anthropic é simples: agente não deve ser avaliado como se fosse apenas um gerador de texto. Ele interage com ferramentas, altera estado, toma decisões sequenciais e pode falhar em pontos intermediários mesmo quando a saída final parece aceitável.

    Por isso, o foco sai de “qual foi a resposta?” e vai para “como a tarefa foi executada?”. Uma eval de habilidade pode verificar se o agente seguiu instruções, chamou a tool certa, respeitou limites de contexto, manteve o estado consistente e concluiu a tarefa sem quebrar contratos.

    Essa mudança também melhora a comparabilidade. Quando o time grava traces e artefatos de execução, fica mais fácil responder se uma alteração de prompt, modelo ou orquestração melhorou o fluxo ou apenas mudou o estilo da resposta.

    Da tarefa à suíte: como estruturar evals de agent skills

    O desenho útil é parecido com o de testes de software, mas adaptado ao comportamento probabilístico. Cada habilidade vira uma unidade testável com um conjunto pequeno de casos.

    1. Defina a habilidade: por exemplo, “seguir instruções em um ticket”, “chamar a ferramenta de busca corretamente” ou “resumir uma conversa sem perder restrições”.
    2. Crie entradas representativas: casos simples, casos ambíguos e casos com restrições explícitas.
    3. Capture a execução: trace, chamadas de ferramenta, artefatos gerados e estado intermediário.
    4. Escreva checks: validações determinísticas quando possível e rubricas para o que depende de julgamento semântico.
    5. Guarde scores por versão: isso permite comparar regressões ao longo do tempo.

    O valor aparece quando a suíte deixa de ser uma coleção de testes soltos e passa a medir capacidades específicas. Assim, você consegue dizer que o agente piorou em “seguir instruções de formato”, mas melhorou em “selecionar ferramentas”.

    undefined
    

    Esse exemplo não pretende ser um framework pronto. Ele mostra a ideia operacional: transformar cada habilidade em critérios observáveis e reduzir a dependência de interpretação manual a cada execução.

    Checks determinísticos e judges: quando usar cada um

    O material da Anthropic destaca uma separação útil entre quatro coisas: o que medir, como medir, quais fontes de evidência usar e quais julgamentos precisam de um modelo avaliador. Na prática, isso vira um arranjo híbrido.

    Checks determinísticos funcionam bem para contratos objetivos: presença de um campo, ordem de passos, uso correto de uma API, ausência de comportamento proibido, conformidade com schema. Já judges ajudam quando a métrica envolve intenção, aderência a instruções abertas ou qualidade de um resumo em linguagem natural.

    O erro comum é usar LLM judge para tudo. Isso torna a avaliação opaca e pode esconder falhas em passos anteriores. O caminho mais robusto é deixar o judge para o que realmente exige interpretação, e manter o restante em regras simples e auditáveis.

    Esta seção descreve a prática de avaliação dos materiais citados em 2025/2026. APIs e frameworks de agentes mudam rápido — confira o changelog oficial da ferramenta antes de adotar o fluxo em produção.

    Rubrica curta é melhor do que critério genérico

    Uma rubrica funciona melhor quando descreve sinais concretos. Em vez de “respondeu bem”, prefira critérios como “citou a ferramenta correta antes de agir”, “preservou a restrição de privacidade” ou “não executou ação fora do escopo pedido”.

    Isso é especialmente útil em agentes com múltiplos passos, porque o erro costuma se propagar. Um pequeno desvio no início pode contaminar o restante do fluxo, então a avaliação precisa olhar trajetória, não só o desfecho.

    Por que traces e artefatos valem ouro na regressão

    Sem evidência de execução, a discussão vira opinião. Com trace e artefatos, a equipe consegue comparar versões do agente no tempo e entender onde o comportamento mudou.

    Esse ponto é importante em qualquer stack, mas pesa mais quando o agente conversa com várias APIs ou executa ações externas. Se uma mudança de prompt melhora a taxa de sucesso, mas aumenta chamadas desnecessárias ou viola instruções com mais frequência, o score agregado pode mascarar um custo operacional maior.

    Em times brasileiros isso aparece rápido no orçamento. Rodar muitas execuções contra APIs pagas, somado a variação cambial e limites de orçamento em BRL, faz diferença quando a suíte precisa ser repetida sempre que há alteração de prompt, modelo ou tool routing.

    Outra dimensão local é latência. Em empresas que servem usuários no Brasil, depender só de infraestrutura fora da região pode tornar o avaliador menos fiel ao ambiente real, porque a experiência do agente muda conforme o tempo de resposta das ferramentas. Avaliar com traces ajuda a separar “erro de raciocínio” de “efeito de infraestrutura”.

    Benchmarks mais ambientados e o que eles ensinam

    O survey citado no brief e o próprio AgentBench apontam para uma evolução dos benchmarks: sair de tarefas muito estáticas e aproximar a avaliação de contextos com múltiplos ambientes. Isso faz sentido porque agentes não vivem só numa única resposta isolada.

    Na prática, a lição é que uma suíte de evals precisa refletir o domínio real. Se o seu agente atende suporte, o benchmark deve incluir tickets com contexto quebrado, anexos faltando e instruções contraditórias. Se ele opera dados, precisa lidar com schema, permissões e estado parcial.

    Quando o benchmark é réalista demais sem organização, ele fica caro e difícil de manter. Quando é simples demais, ele mede habilidade de prompt, não de agente. O equilíbrio está em definir o mínimo de ambiente necessário para capturar o comportamento que importa.

    Um fluxo de trabalho enxuto para começar

    Para sair da teoria sem montar uma operação pesada logo de início, vale seguir um recorte curto.

    1. Escolha três habilidades críticas do seu agente.
    2. Escreva cinco casos por habilidade, cobrindo caminho feliz, borda e restrição.
    3. Registre traces e artefatos de cada run.
    4. Crie checks objetivos primeiro e só depois adicione judges onde houver ambiguidade real.
    5. Compare uma versão nova contra uma linha de base antes de liberar mudanças maiores.

    Esse fluxo serve bem para startups, squads de plataforma e times internos em empresas brasileiras que precisam justificar custo antes de ampliar o uso de agentes. É uma forma de transformar discussão de “parece melhor” em “passou ou não passou”.

    Por que importa pro dev brasileiro

    No Brasil, construir e manter agentes costuma disputar orçamento com outras prioridades de produto e infraestrutura. Como muitos times pagam modelos e ferramentas em moeda forte, um conjunto de evals reduz o risco de testar mudança em produção só para descobrir depois que a regressão era previsível.

    Há também um componente regulatório concreto. Se o agente toca dados pessoais, a LGPD exige cuidado com coleta, retenção e finalidade; isso torna importante medir não só qualidade, mas também vazamento de contexto, exposição indevida de informação e comportamento fora de política. Uma eval bem desenhada pode incluir checks para não transitar dados sensíveis sem necessidade.

    Por fim, a realidade operacional brasileira inclui dependência frequente de regiões como us-east-1 e integrações externas com resposta variável. Evals com trace ajudam a separar falha do modelo, falha da tool e falha da infraestrutura, o que acelera diagnóstico em equipes enxutas.

    Conclusão

    Evals para agent skills são uma forma de deixar o comportamento de agentes testável, comparável e auditável. Em vez de confiar em avaliações pontuais, você passa a medir habilidades específicas com evidências de execução, checks objetivos e rubricas claras para os casos sem resposta binária.

    Se o seu agente já integra ferramentas, manipula estado ou executa passos encadeados, vale tratar cada habilidade como uma experiência reproduzível. O próximo passo prático é pegar uma habilidade crítica do seu fluxo, escrever cinco casos e definir um score mínimo de aprovação antes da próxima mudança de prompt ou modelo.

    Ação para a próxima hora: abra a documentação do Testing Agent Skills Systematically with Evals e escolha uma habilidade do seu agente para transformar em suíte de cinco casos com trace, checks e pontuação.

    Conteúdos da DIO para quem quer aprofundar

    Compartilhe
    Recomendados para você
    Microsoft Certification Challenge #5 - AI 102
    Bradesco - GenAI & Dados
    GitHub Copilot - Código na Prática
    Comentários (0)