ANÁLISE EDITORIAL / 2026-09-28 — 2026-10-02
Benchmark de dados corporativos em escala real
Argo-Bench testa agentes em um ERP sintético com 235 tabelas e 7,5 bilhões de linhas.
Em cs.CL, Argo-Bench é o destaque para quem pensa em agentes sobre dados corporativos. O benchmark simula uma plataforma de entregas em Nova York em escala real, com 81 milhões de pedidos, padrões de fraude e incentivos, e exporta tudo para um warehouse no esquema do Oracle E-Business Suite. O agente precisa reconstruir fatos navegando pelas tabelas e então agir, por exemplo banindo contas fraudulentas ou alocando orçamento, e é avaliado pelas consequências dessas ações no simulador. O melhor de 14 modelos atinge 95 pontos ou mais em apenas 34,8% das tarefas. Para bancos, o paralelo com prevenção a fraude, conciliação e relatórios regulatórios é direto: o text-to-SQL não basta. O QuantCode, também listado em cs.CL, completa o tema com LLMs especializados em código de trading. A cobertura do tema é estreita, porque só 50 títulos de sexta-feira foram lidos.
EVOLUÇÃO
Na W39, o destaque era compliance financeiro com RAG de domínio; agora o foco passa de responder sobre documentos para agir sobre dados.
O QUE FAZER COM ISSO
Provas de conceito de agentes analíticos devem ser julgadas por ações e consequências em dados realistas, não por acerto de SQL.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.