AI Agent Evals: como testar decisões e trajetórias, não apenas respostas de LLMs
Evals para AI Agents: golden trajectories, tool choice, policy respect, custo, simulação, LLM-as-judge, online vs offline. Por que 89% observam e só 52% avaliam — e como fechar o loop no harness.
Por Emerson Amorim · Fundador e Principal Software Engineer
Times avaliam LLMs como avaliam redação: BLEU, ROUGE, “o juiz GPT deu 4/5”. Agentes não são redação. São políticas em movimento. O State of Agent Engineering da LangChain mostrou o gap: filmar (89%) é comum; dar nota ao filme (52% offline, 37% online) ainda é minoria. Qualidade é a barreira número um para produção. Não é coincidência.
O artigo de Agent Harness já cravou: evals analisam a trajetória completa. Este texto vira isso em programa.
O que medir na trajetória
- Task success — o desfecho de negócio aconteceu?
- Tool selection — a tool certa, não uma prima alucinada.
- Argument validity — schema, ranges, destinos allowlisted.
- Policy respect — zero side effect em deny; HITL quando exigido.
- Untrusted influence — a decisão de permissão veio de SYSTEM ou de um PDF?
- Custo e latência — um sucesso de R$ 40 de token em tarefa de R$ 2 falhou de outra forma.
- Recovery — em long-running, retomou sem duplicar side effect?
Offline: golden trajectories
Monte um set de runs anotados: input, contexto, tools disponíveis, trajetória aceitável (pode haver mais de um caminho), desfecho. Inclua casos adversos — descrições envenenadas, páginas injetadas, budget curto. Cada release de prompt, modelo, tool ou política roda o set. Falhou = não sobe. Traces ruins de produção são a melhor fonte de novos casos (o loop do artigo de observability).
Simulação e shadow
Ambientes em que as tools são stubs ou sandboxes. Shadow: o agente “roda” em produção sem side effect, compara com o sistema legado ou com o humano. Útil em migração. Perigoso se o shadow ainda chama a tool real — aí não é shadow.
Online evals
Amostra de runs reais, juízes mistos: determinísticos primeiro, LLM-as-judge depois, humano na cauda. 37% dos times já fazem; 44,8% entre quem está em produção. Sem redaction de PII, você cria um segundo incidente. Sem amostragem enviesada só para “runs bonitos”, você mente para si.
Loop de qualidade
- 01Prodtraces
- 02Clusterfalhas
- 03Goldenoffline
- 04GateCI
- 05Onlineamostra
- 06Fixprompt/tool/policy
Evals de coding agents
Aqui o oráculo é o test suite, o contract test, o linter de secret, o “PR revertido”. Não declare vitória por “compilou”. Declare por “não quebrou o contrato da API e passou no policy de dependências”.
function score(traj: Trajectory): { pass: boolean; reasons: string[] } {
const reasons: string[] = [];
if (traj.hallucinatedTools.length) reasons.push("hallucinated_tool");
if (traj.policyDeniesIgnored) reasons.push("policy_bypass");
if (!traj.businessOutcome) reasons.push("task_fail");
if (traj.costUsd > traj.budgetUsd) reasons.push("budget");
return { pass: reasons.length === 0, reasons };
}EmerAgents
Na fábrica, eval não é um notebook do cientista. É gate da esteira, igual a SAST. EmerAgents grava trajetória; o set cresce com os incidentes; o modelo só troca de versão se o score de caminho aguenta. Inteligência nova não compra o direito de furar política velha.
Conclusão
AI Agent Evals são a metade que o mercado ainda deve. Observar sem avaliar é CCTV. Avaliar só o texto é crítica de cinema. Avaliar trajetória — tools, args, policy, desfecho, custo — é engenharia. Feche o loop. É o que torna o cluster Agent Engineering um sistema, não uma biblioteca de posts.
Pronto para acelerar seu software enterprise?
Fale com a EmerSoft sobre fábrica de software, EmerAgents e integrações SAP, AWS e Azure — com entrega acelerada e padrão enterprise.
LinkedIn · Emerson Amorim
Avaliar o texto final do agente é avaliar o final do filme pelo poster.
LangChain 2026: observability 89%, evals offline 52%, online 37%. Quase um terço ainda não avalia. O que um eval de AI Agent precisa olhar: • tool certa? • args válidos? • política respeitada? • desfecho de negócio? • custo aceitável? • conteúdo untrusted influenciou permissão? Artigo: https://www.emersoftware.com.br/blog/ai-agent-evals-trajetorias — Emerson Amorim, EmerSoftware
Continue lendo
AI Agent Observability: como descobrir por que seu agente falhou em produção
89% dos times já observam agentes; só 52% avaliam. Ver a trajetória sem julgá-la é CCTV sem segurança. Observability de agente é infraestrutura, não dashboard bonito.
MCP Security: como impedir Tool Poisoning, Prompt Injection e ataques em AI Agents
A descrição da tool é instrução. Se o MCP mistura metadata com política, um servidor “aprovado” vira canal de exfiltração — e cada ação isolada ainda parece legítima.
AI Coding Agents estão substituindo o Copilot tradicional? A arquitetura da engenharia de software agentic
Autocomplete → copilot → coding agent → background agent → time de engenharia agentic. O IDE deixou de ser o produto. O harness de engenharia passou a ser.