EmerSoftwareSoftware Factory
EmerAgents17 min de leitura

AI Agent Evals: como testar decisões e trajetórias, não apenas respostas de LLMs

Evals para AI Agents: golden trajectories, tool choice, policy respect, custo, simulação, LLM-as-judge, online vs offline. Por que 89% observam e só 52% avaliam — e como fechar o loop no harness.

Retrato profissional de Emerson Amorim, fundador da EmerSoftware

Por Emerson Amorim · Fundador e Principal Software Engineer

#AIAgentEvals#agentevaluation#trajectoryevals#AIAgents#observability#EmerAgents

Times avaliam LLMs como avaliam redação: BLEU, ROUGE, “o juiz GPT deu 4/5”. Agentes não são redação. São políticas em movimento. O State of Agent Engineering da LangChain mostrou o gap: filmar (89%) é comum; dar nota ao filme (52% offline, 37% online) ainda é minoria. Qualidade é a barreira número um para produção. Não é coincidência.

O artigo de Agent Harness já cravou: evals analisam a trajetória completa. Este texto vira isso em programa.

O que medir na trajetória

  • Task success — o desfecho de negócio aconteceu?
  • Tool selection — a tool certa, não uma prima alucinada.
  • Argument validity — schema, ranges, destinos allowlisted.
  • Policy respect — zero side effect em deny; HITL quando exigido.
  • Untrusted influence — a decisão de permissão veio de SYSTEM ou de um PDF?
  • Custo e latência — um sucesso de R$ 40 de token em tarefa de R$ 2 falhou de outra forma.
  • Recovery — em long-running, retomou sem duplicar side effect?

Offline: golden trajectories

Monte um set de runs anotados: input, contexto, tools disponíveis, trajetória aceitável (pode haver mais de um caminho), desfecho. Inclua casos adversos — descrições envenenadas, páginas injetadas, budget curto. Cada release de prompt, modelo, tool ou política roda o set. Falhou = não sobe. Traces ruins de produção são a melhor fonte de novos casos (o loop do artigo de observability).

Simulação e shadow

Ambientes em que as tools são stubs ou sandboxes. Shadow: o agente “roda” em produção sem side effect, compara com o sistema legado ou com o humano. Útil em migração. Perigoso se o shadow ainda chama a tool real — aí não é shadow.

Online evals

Amostra de runs reais, juízes mistos: determinísticos primeiro, LLM-as-judge depois, humano na cauda. 37% dos times já fazem; 44,8% entre quem está em produção. Sem redaction de PII, você cria um segundo incidente. Sem amostragem enviesada só para “runs bonitos”, você mente para si.

Loop de qualidade

  1. 01Prodtraces
  2. 02Clusterfalhas
  3. 03Goldenoffline
  4. 04GateCI
  5. 05Onlineamostra
  6. 06Fixprompt/tool/policy
Observability alimenta eval. Eval alimenta release. Release alimenta produção. Sem a aresta eval, o ciclo é voyeurismo.

Evals de coding agents

Aqui o oráculo é o test suite, o contract test, o linter de secret, o “PR revertido”. Não declare vitória por “compilou”. Declare por “não quebrou o contrato da API e passou no policy de dependências”.

ts
function score(traj: Trajectory): { pass: boolean; reasons: string[] } {
  const reasons: string[] = [];
  if (traj.hallucinatedTools.length) reasons.push("hallucinated_tool");
  if (traj.policyDeniesIgnored) reasons.push("policy_bypass");
  if (!traj.businessOutcome) reasons.push("task_fail");
  if (traj.costUsd > traj.budgetUsd) reasons.push("budget");
  return { pass: reasons.length === 0, reasons };
}
Um eval mínimo — determinístico antes de opinião.

EmerAgents

Na fábrica, eval não é um notebook do cientista. É gate da esteira, igual a SAST. EmerAgents grava trajetória; o set cresce com os incidentes; o modelo só troca de versão se o score de caminho aguenta. Inteligência nova não compra o direito de furar política velha.

Conclusão

AI Agent Evals são a metade que o mercado ainda deve. Observar sem avaliar é CCTV. Avaliar só o texto é crítica de cinema. Avaliar trajetória — tools, args, policy, desfecho, custo — é engenharia. Feche o loop. É o que torna o cluster Agent Engineering um sistema, não uma biblioteca de posts.

Pronto para acelerar seu software enterprise?

Fale com a EmerSoft sobre fábrica de software, EmerAgents e integrações SAP, AWS e Azure — com entrega acelerada e padrão enterprise.

LinkedIn · Emerson Amorim

Avaliar o texto final do agente é avaliar o final do filme pelo poster.

LangChain 2026: observability 89%, evals offline 52%, online 37%. Quase um terço ainda não avalia. O que um eval de AI Agent precisa olhar: • tool certa? • args válidos? • política respeitada? • desfecho de negócio? • custo aceitável? • conteúdo untrusted influenciou permissão? Artigo: https://www.emersoftware.com.br/blog/ai-agent-evals-trajetorias — Emerson Amorim, EmerSoftware

WhatsApp (15) 99143-7215