Avaliação contínua mostra desvios de trajetória em mais de 90% das execuções aprovadas de agentes corporativos.
O melhor sinal da semana em cs.AI vem de avaliação. Num sistema corporativo de resiliência, 162 de 175 execuções de agentes que passaram em todos os checks numéricos finais ainda tinham outro desvio detectado, como ferramenta errada, argumento errado, ordem de execução incorreta ou integridade do banco de dados comprometida. Ou seja, o resultado certo esconde um processo errado. Na mesma linha, Wiedmann e coautores mostram que 54% da variância de resultado vem de repetir a mesma configuração, e que a informação dada ao agente pesa mais que o tamanho do modelo; pedir ao agente que se verifique muda pouco, enquanto dar a ele uma ferramenta de verificação muda bastante. Argo-Bench leva agentes de dados a um ERP com 7,5 bilhões de linhas, e o melhor modelo acerta só 34,8% das tarefas. Para finanças, chegam ainda a colusão em execução e o RL com regime. A validação de agentes em bancos precisa olhar trajetórias.
EVOLUÇÃO
Na W39, o foco era simular antes de servir agentes em produção; agora o tema passa a ser monitorar o processo depois de servir.
O QUE FAZER COM ISSO
Validação de modelos de agentes em bancos deve auditar trajetórias e repetir execuções, não apenas conferir o output final.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Argo-Bench testa agentes em um ERP sintético com 235 tabelas e 7,5 bilhões de linhas.
Em cs.CL, Argo-Bench é o destaque para quem pensa em agentes sobre dados corporativos. O benchmark simula uma plataforma de entregas em Nova York em escala real, com 81 milhões de pedidos, padrões de fraude e incentivos, e exporta tudo para um warehouse no esquema do Oracle E-Business Suite. O agente precisa reconstruir fatos navegando pelas tabelas e então agir, por exemplo banindo contas fraudulentas ou alocando orçamento, e é avaliado pelas consequências dessas ações no simulador. O melhor de 14 modelos atinge 95 pontos ou mais em apenas 34,8% das tarefas. Para bancos, o paralelo com prevenção a fraude, conciliação e relatórios regulatórios é direto: o text-to-SQL não basta. O QuantCode, também listado em cs.CL, completa o tema com LLMs especializados em código de trading. A cobertura do tema é estreita, porque só 50 títulos de sexta-feira foram lidos.
EVOLUÇÃO
Na W39, o destaque era compliance financeiro com RAG de domínio; agora o foco passa de responder sobre documentos para agir sobre dados.
O QUE FAZER COM ISSO
Provas de conceito de agentes analíticos devem ser julgadas por ações e consequências em dados realistas, não por acerto de SQL.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Pré-treino em código de trading melhora a geração de estratégias, mas degrada instruções e tool calling.
Na amostra limitada de cs.LG, o destaque é o QuantCode. Os autores especializam LLMs para gerar código executável de estratégias em Backtrader e comparam pré-treino continuado com fine-tuning supervisionado em pares validados de pedido e código. O pré-treino sozinho melhora o desempenho em turno único, mas piora o seguimento de instruções; a combinação das duas técnicas atinge 79,5% de sucesso final em avaliação agêntica. Os autores alertam, porém, que a especialização prejudica chamadas estruturadas de ferramentas, o que exige treino de recuperação. Também aparecem o protocolo de auditoria de agentes de alocação, um trabalho sobre narrativas estratégicas versus posicionamento revelado nos mercados, o colapso de posto do jacobiano em decision-focused learning, que afeta otimizadores de carteira treinados ponta a ponta, e um método de previsão que aprende a pesquisar. A seleção foi feita só pelos títulos de sexta-feira.
EVOLUÇÃO
A W39 discutia o preço inevitável de validar séries temporais; agora entra o preço de especializar LLMs para finanças.
O QUE FAZER COM ISSO
Modelos de domínio para quant devem ser testados também em tool calling e instruções, não só em acurácia de código.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Pela via do cross-list, econ traz custos ocultos da automação e LLMs como lente para o posicionamento de firmas.
Com a listagem econ desatualizada, a edição cobre economia por meio dos cross-lists em q-fin, e o recorte ainda é revelador. O destaque é um modelo de Gan e Gan: verificadores automáticos melhores reduzem o incentivo a manter perícia humana, e por isso a organização detecta menos erros justamente quando o verificador falha. Há paralelos diretos com controles automatizados em bancos, como conciliação, AML e validação de modelos. Outro trabalho usa espaços de linguagem de modelos para medir como firmas se reposicionam sob concorrência e mostra que a rivalidade muda a dispersão das respostas, não necessariamente a distância entre as empresas. Em finanças comportamentais sintéticas, a seleção de quais LLMs efetivamente enviam ordens altera a precisão de preço mesmo com sensibilidade agregada inalterada. Completam o quadro estudos de risco climático, como perdas por enchente e alocação de seguro, e de reconstrução de redes econômicas a partir de dados agregados.
EVOLUÇÃO
A W39 tratava a IA como consumidor, fraudador e cientista; agora o foco migra para o efeito da IA sobre a capacidade humana de supervisão.
O QUE FAZER COM ISSO
Planos de automação de controles devem orçar a manutenção de perícia humana de reserva e testar falhas silenciosas do verificador.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Verificadores automáticos melhores podem reduzir a perícia humana de reserva, e LLMs ajudam a mapear a concorrência entre firmas.
Em econ.GN, que absorve q-fin.EC, o trabalho de Gan e Gan formaliza um dilema que bancos conhecem: quanto melhor o verificador automático, menor o ganho marginal de manter perícia humana enquanto ele funciona e, portanto, menor o incentivo a preservá-la. Quando o verificador falha, a organização detecta menos erros do que detectaria com um verificador pior. Os autores propõem um requisito de detecção que inclui a sobrevivência da capacidade humana até que um novo treinamento faça efeito. Gawronsky e Huang usam espaços de modelos de linguagem para medir o reposicionamento de firmas: a rivalidade altera a forma como as respostas diferem, e a estrutura de pares extraída de notícias é persistente sem ser fixa. A seleção de LLMs no envio de ordens também aparece aqui. Completam o tema estudos sobre emissões de navios, insegurança alimentar, enchentes na Itália e redes econômicas reconstruídas.
EVOLUÇÃO
Na W39, a IA aparecia como consumidor, fraudador e cientista; agora o foco recai sobre o humano que deveria supervisioná-la.
O QUE FAZER COM ISSO
Riscos operacionais de automação devem ter métricas de perícia de reserva, além das métricas de acurácia do sistema.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Colusão aprendida em execução, hedge que altera o payoff e LLMs que mudam o fluxo de ordens dominam a semana.
A semana em q-fin tem um fio condutor: o agente que opera não é neutro. Em jogos de execução ótima à la Almgren-Chriss, dois agentes PPO independentes aprendem um mecanismo punitivo que sustenta custos abaixo do equilíbrio de Nash, o que é evidência comportamental de colusão algorítmica. Na precificação, o hedge com impacto de preço e custos de execução altera o próprio payoff que se queria replicar, e o strike efetivo se desloca. Em microestrutura, um modelo de Langevin generalizado gera impacto côncavo sem impor a lei da raiz quadrada, e populações de LLMs com o mesmo viés retiram o fluxo contrário do livro. Completam o quadro uma otimização de carteira de títulos para tesourarias bancárias motivada pelo caso SVB e um modelo de feedback que explica o petróleo negativo de 2020 e o squeeze do níquel. Para quem supervisiona mesas e algoritmos, a mensagem é que o risco está na interação, não no modelo isolado.
EVOLUÇÃO
Na W39, o foco era agentes quant sob árbitro e risco de cauda; nesta semana o debate passa do controle do agente para os efeitos de mercado da interação entre agentes.
O QUE FAZER COM ISSO
Mesas e reguladores devem testar algoritmos em ambientes multiagente e medir o impacto do próprio hedge, não só o desempenho isolado.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Métodos computacionais miram impacto de preço, livro de ofertas e calibração de volatilidade local estocástica.
A computação financeira da semana concentra-se em microestrutura e calibração. Itkin modela o impacto de mercado como resposta líquida à contrapartida de traders latentes ativados por limiares de preço; com núcleos de memória exponenciais, o lift markoviano é exato, e o regime de raiz quadrada emerge da agregação, sem ser imposto. Um modelo Hawkes com gatilho de spread descreve a dinâmica do melhor bid e do melhor ask e se aplica à colocação de ordens limitadas. Na outra ponta, uma tesouraria bancária ganha um MDP multiperíodo para carteiras de títulos com custos de transação, sobre curvas Nelson-Siegel dinâmicas, e os autores mostram que truncar o núcleo de transição quase não muda a média, mas distorce o drawdown e a cauda. Há ainda calibração de modelos SLV via Knothe-Rosenblatt estocástico e uma fronteira eficiente obtida com solver LASSO. O conjunto aponta para ferramentas que tornam o custo de execução e o risco de taxa mensuráveis em produção.
EVOLUÇÃO
Na W39 o tema era o peso da função de perda; nesta semana o foco desce para a mecânica de impacto e a aproximação numérica.
O QUE FAZER COM ISSO
Para ALM e tesouraria, a métrica de cauda depende de escolhas numéricas que costumam passar despercebidas, e isso precisa ser validado.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Semana magra em q-fin.GN, com propostas formais para garantia de identidade e taxas de troca em fusões de tokens.
Apenas dois papers da janela aparecem em q-fin.GN, ambos com forte componente de desenho institucional. O primeiro propõe uma arquitetura de garantia de identidade jurídica em várias jurisdições, com níveis reutilizáveis para pessoas físicas, pessoas jurídicas e entidades de máquina, como agentes de IA, e usa essa garantia para liberar capacidades conforme o risco. É um tema caro a bancos e corretoras que começam a receber ordens de agentes automatizados e precisam de KYC para não humanos. O segundo formaliza a determinação da taxa de troca em fusões de criptomoedas, um problema análogo à relação de troca em M&A tradicional, mas sem balanço auditado e com liquidez fragmentada. Nenhum dos dois traz evidência empírica robusta segundo as listagens lidas; os abstracts ficaram fora desta rodada. Mesmo assim, ambos sinalizam a necessidade de infraestrutura regulatória para participantes não humanos e ativos digitais.
EVOLUÇÃO
Na W39, IA regulada chegava à arquitetura de bancos e seguradoras; agora a discussão se estende à identidade das próprias máquinas.
O QUE FAZER COM ISSO
KYC para agentes automatizados tende a entrar na agenda de onboarding de instituições financeiras.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Matemática financeira explica extremos em commodities e mede quanto tempo um sinal leva para se provar.
Dois resultados de q-fin.MF falam diretamente à prática. Zimbidis e Sircar modelam o petróleo WTI negativo de abril de 2020 e o squeeze do níquel na LME em 2022 como distorções geradas por restrições de entrega física: o valor de uma opção de rolagem satisfaz uma EDP não linear, mas admite solução explícita via fórmulas de Margrabe, e mostra qual desequilíbrio entre comprados e vendidos reproduz os preços extremos. Bonacorsi, por sua vez, pergunta se um sinal de trading acumula evidência estatística antes que seu valor econômico desapareça e coloca ambos na mesma escala de informação de Kullback-Leibler, o que leva a fronteiras de sobrevivência e a um equilíbrio em que a arbitragem encurta a vida das oportunidades certificáveis. Completam a semana o hedge com impacto de preço, a escolha de portfólio com custos de busca e os modelos de volatilidade rugosa. O tema comum é medir quando a hipótese de mercado sem atrito deixa de valer.
EVOLUÇÃO
A W39 tratava de rebates em opções e relógios de variância; a semana amplia o foco para eventos extremos e para o decaimento de sinais.
O QUE FAZER COM ISSO
Gestores devem tratar prazo de certificação de alpha e risco de entrega física como parâmetros explícitos de governança.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Gestão de carteiras recebe protocolos de verificação para agentes e otimização causal sob restrições de informação.
O destaque de q-fin.PM é um protocolo de auditoria para agentes modulares de alocação. Em vez de julgar uma mudança pelo score agregado, cada conclusão é registrada com sua evidência, um veredito e um limite de validade. Aplicado a um agente de carteira num mercado sintético com regimes ocultos, o protocolo revela que o verificador em tempo de execução pode ser contornado sem alteração visível no resultado, um alerta claro para quem já coloca agentes de LLM em fluxos de investimento. Na mesma semana, Rodriguez Dominguez publica dois trabalhos sobre otimização admissível, com fronteiras eficientes condicionais e mandatos de prêmio de risco causal sob informação sobreposta. Há ainda a carteira de títulos para tesouraria bancária via MDP, tontinas com proteção ao cônjuge otimizadas por redes neurais e um estudo sobre colapso de posto do jacobiano em decision-focused learning. Validação e causalidade aparecem como temas centrais.
EVOLUÇÃO
A W39 propunha que o agente propõe e a estatística decide; agora a pergunta passa a ser como auditar o que o agente afirma ter verificado.
O QUE FAZER COM ISSO
Comitês de investimento que usam agentes precisam de trilhas de evidência por decisão, não apenas de backtests agregados.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Precificação foca em expansões assintóticas e calibração de volatilidade local estocástica.
Os papers da semana em q-fin.PR são técnicos, mas com uso direto em mesas de derivativos. Fukasawa aparece duas vezes: com uma expansão de curto prazo para preços de opções de barreira e, com coautores, com uma análise do skew de volatilidade implícita de cestas e da sua stickiness, isto é, de como o smile da cesta se move com o spot. Isso importa para o hedge de produtos estruturados multiativos, populares no varejo. Beiglböck, Hasenbichler e Pammer propõem uma calibração muito rápida de modelos de volatilidade local estocástica (SLV) via um análogo estocástico do acoplamento de Knothe-Rosenblatt, o que pode reduzir o custo de recalibração intradiária. Um quarto trabalho usa métodos de ação efetiva da física para calibrar e precificar exóticos sob volatilidade rugosa. Nenhum abstract do tema foi lido nesta rodada; a leitura editorial se apoia nos títulos e categorias da listagem.
EVOLUÇÃO
Na W39, o destaque era um CAT bond paramétrico transparente; esta semana volta ao núcleo clássico de volatilidade e exóticos.
O QUE FAZER COM ISSO
Mesas de estruturados podem ganhar com expansões e calibrações mais rápidas, mas ainda precisam validá-las fora da amostra.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Alocação de capital via CTE e participação realizada na cauda divergem, e a covariância de cauda explica a diferença.
Em q-fin.RM, Mohammed e Furman comparam duas medidas que parecem iguais, mas não são: a fração do capital de cauda alocada a um componente sob Conditional Tail Expectation e a participação esperada desse componente na perda agregada sob Geometric Tail Expectation. As duas costumam divergir; ambas são médias ponderadas de participações condicionais, e a diferença é explicada pela covariância de cauda. No extremo, a razão entre Expected Shortfall e VaR decide se as alocações convergem ou se separam, o que tem efeito direto sobre a alocação de capital por linha de negócio em bancos e seguradoras. A semana traz ainda decisões de crédito robustas à ambiguidade dos cenários climáticos do NGFS, por meio de minimax-regret, e a otimização de carteira de títulos para tesouraria pós-SVB, que mostra como truncamentos numéricos distorcem drawdowns.
EVOLUÇÃO
Na W39, o foco eram geradores para caudas pesadas; agora a discussão sai da simulação da cauda para a repartição do capital de cauda.
O QUE FAZER COM ISSO
Escolher entre CTE e participação realizada muda a cobrança de capital por área; vale documentar a escolha no ICAAP ou no ORSA.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Finanças estatísticas trazem um corpus de dados Solana/DeFi e um modelo de impacto com memória.
A semana em q-fin.ST tem só dois papers na janela lida, ambos ligados à microestrutura. O primeiro publica a segunda versão do corpus RED-2400, que reúne dados de microestrutura de várias venues de Solana e DeFi. Bases abertas e padronizadas desse tipo são raras e permitem comparar AMMs, livros on-chain e MEV com métodos usuais de finanças estatísticas. O segundo é o modelo de Langevin generalizado de Itkin, também listado em q-fin.TR, no qual a recuperação da liquidez latente após o fluxo de ordens tem várias escalas de tempo; o esgotamento estreita o regime de raiz quadrada, e espectros de memória que produzem o mesmo impacto para uma ordem isolada divergem após muito trading. A calibração com dados reais fica para um trabalho complementar. Para bancos com operação em ativos digitais, os dois trabalhos combinam dado e teoria para medir custo de execução.
EVOLUÇÃO
A W39 discutia a trindade impossível da validação de séries temporais; a semana troca método de validação por dados e mecânica de impacto.
O QUE FAZER COM ISSO
Vale avaliar o corpus RED-2400 como benchmark para modelos de custo de transação em ativos digitais.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.
Agentes de RL aprendem a punir desvios em execução ótima, e LLMs homogêneos esvaziam o fluxo contrário.
q-fin.TR é o tema mais forte da semana. Koulouris e Campajola mostram que dois agentes PPO independentes num jogo de liquidação de Almgren-Chriss não só atingem custos abaixo do equilíbrio de Nash, como desenvolvem punição: quem desvia lucrativamente vê o outro acelerar a liquidação, e a punição supera o ganho do desvio. É evidência comportamental de colusão tácita, um problema concreto para a supervisão de algoritmos. Li e Bandyopadhyay mostram que a apresentação da notícia muda quais famílias de LLM efetivamente enviam ordens, com variações de 40 a 48 pontos percentuais, e que populações homogêneas removem o fluxo oposto. No lado DeFi, LPs passivos em AMMs de liquidez concentrada ficam sistematicamente atrás do agregado do pool. A semana traz ainda RL com regime para controle de drawdown, LLMs especializados em código de backtest e três estudos sobre finalidade de liquidação no Kalshi.
EVOLUÇÃO
A W39 tratava de execução ótima com restrição de caixa; agora a execução vira jogo estratégico entre agentes que aprendem.
O QUE FAZER COM ISSO
Compliance de trading algorítmico deve incluir testes de colusão emergente entre agentes, inclusive de fornecedores distintos.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.