ANÁLISE EDITORIAL / 2026-09-28 — 2026-10-02
Agente que passa no teste ainda erra o processo
Avaliação contínua mostra desvios de trajetória em mais de 90% das execuções aprovadas de agentes corporativos.
O melhor sinal da semana em cs.AI vem de avaliação. Num sistema corporativo de resiliência, 162 de 175 execuções de agentes que passaram em todos os checks numéricos finais ainda tinham outro desvio detectado, como ferramenta errada, argumento errado, ordem de execução incorreta ou integridade do banco de dados comprometida. Ou seja, o resultado certo esconde um processo errado. Na mesma linha, Wiedmann e coautores mostram que 54% da variância de resultado vem de repetir a mesma configuração, e que a informação dada ao agente pesa mais que o tamanho do modelo; pedir ao agente que se verifique muda pouco, enquanto dar a ele uma ferramenta de verificação muda bastante. Argo-Bench leva agentes de dados a um ERP com 7,5 bilhões de linhas, e o melhor modelo acerta só 34,8% das tarefas. Para finanças, chegam ainda a colusão em execução e o RL com regime. A validação de agentes em bancos precisa olhar trajetórias.
EVOLUÇÃO
Na W39, o foco era simular antes de servir agentes em produção; agora o tema passa a ser monitorar o processo depois de servir.
O QUE FAZER COM ISSO
Validação de modelos de agentes em bancos deve auditar trajetórias e repetir execuções, não apenas conferir o output final.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.