Simulação de agentes de atendimento em escala bancária, governança coletiva de agentes em crédito e árbitros para agentes quant.
Dos candidatos de cs.AI, 39 papers entraram no grafo. O destaque vem de um banco digital com 140 milhões de clientes: simulação de clientes para testar agentes de atendimento antes do deploy, detectando intenção, seguindo políticas e evitando respostas não conformes em setor regulado. Na governança, um trabalho mostra que agentes individualmente conformes em crédito, fraude e cobrança podem ser coletivamente discriminatórios, e propõe controle no nível do sistema. Na pesquisa quant, o árbitro sequencial para agentes que mineram fatores e o AlphaDiverse, agentes locais pós-treinados para diversificar a busca de alfa sem APIs externas. Há ainda compilação de fatos na ingestão para QA sobre corpora com revisões (aplicado a textos do Federal Reserve), guardas de precisão para agentes que alteram infraestrutura e auditoria de influência adversária em deliberation multiagente. O recado: o gargalo migrou da capacidade para a verificação em produção.
EVOLUÇÃO
W38 destacou agentes de trading, robustez e contágio; a W39 avança para como validar e governar esses agentes antes e depois do deploy.
O QUE FAZER COM ISSO
Bancos devem criar ambientes de simulação e controles de nível de sistema antes de colocar agentes em atendimento e crédito.
Pré-seleção por título sobre cobertura parcial: só ~50 de ~1.200 títulos da janela foram listados (WebFetch ignorou paginação); a maioria dos candidatos é de 25/09 ou veio por cross-list. Resumos via WebFetch, alguns parafraseados.
QA regulatório verificável, guardrails para text-to-SQL e juízes LLM sob escrutínio.
Dos candidatos de cs.CL, 29 papers entraram no grafo. O destaque ataca QA de compliance em serviços financeiros, onde regulamentos densos e emendados exigem resposta ancorada no texto oficial: modelos adaptados ao domínio com recuperação melhoram a fundamentação verificável. Para dados empresariais, ModularSQL mostra que a acurácia de execução baseada em conjuntos esconde erros de multiplicidade de linhas em text-to-SQL e propõe guardrail em runtime — relevante para quem expõe bases de risco e posições a analistas via linguagem natural. TimeBraid unifica modelos de séries temporais e linguagem para previsão explicável. Grafos semânticos estocásticos propagam incerteza pela cadeia de evidências de agentes, e vários trabalhos questionam a reprodutibilidade de rankings de avaliação e a confiabilidade de juízes LLM, além de modelos de decisão cujo resultado vira com contexto natural.
EVOLUÇÃO
W38 falou de assistentes empresariais sob pressão; a W39 mostra respostas concretas: fundamentação regulatória e guardrails de SQL.
O QUE FAZER COM ISSO
Assistentes de compliance e text-to-SQL em bancos precisam de guardrails de execução e citação obrigatória da norma.
Pré-seleção por título sobre cobertura parcial (~50 de ~659 títulos, só 25/09). Resumos via WebFetch, dois parafraseados.
Trindade impossível da validação, unlearning de dados de mercado e fine-tuning com restrição de chance.
Dos candidatos de cs.LG, 21 papers entraram no grafo. O destaque prova que validação de séries temporais não pode ser simultaneamente suficiente, abrangente e causal, dando fundamento formal às escolhas de backtest. Em seguida, um benchmark de machine unlearning pergunta se dá para remover um ano de dados de mercado de um previsor quando a licença expira, sem retreinar do zero — tema contratual real para quem licencia dados. Na segurança, fine-tuning com restrição de chance controla a probabilidade de regressão em prompts críticos, não só a média. Para dados empresariais, 'linhas idênticas que discordam' mostram como duplicatas escondem uma camada de medição que afeta benchmarks e detecção de anomalias, e frameworks zero-trust coordenam agentes em engenharia de dados. Também há crítica ao uso de teoria clássica de testes para juízes LLM e seleção online de janelas em portfólios.
EVOLUÇÃO
W38 tratou de retrieval, benchmarks e look-ahead em séries temporais; a W39 aprofunda a discussão de validação e governança dos dados de treino.
O QUE FAZER COM ISSO
Políticas de dados de mercado licenciados devem prever custo e evidência de unlearning ao fim do contrato.
Pré-seleção por título com cobertura muito parcial (~50 de ~1.230 títulos; limite de taxa e paginação ignorada). Maior parte dos papers veio por cross-list. Resumos via WebFetch.
Raciocínio melhor nem sempre vira retorno; conluio oculto e colisão de nomes ameaçam sistemas multiagente.
Dos candidatos de cs.MA, 18 papers entraram no grafo. O destaque testa se melhor qualidade de raciocínio em debate multiagente se traduz em melhor desempenho econômico em trading simulado, separando explicabilidade, consenso e retorno — pergunta central para quem pretende usar comitês de agentes em decisões de investimento. A governança coletiva de agentes em instituições financeiras e o AlphaDiverse reaparecem aqui. Do lado de riscos, Codetta demonstra conluio de alta capacidade e indetectável entre agentes via mensagens em linguagem natural, e ataques por colisão de nomes em Agent Cards do protocolo A2A expõem falhas de identidade. Há ainda auditoria de roteamento por confiança, filtros conformais que não confundem concordância com verificação e a arquitetura multiagente para seguradoras sob Solvência II. Em conjunto, o tema indica que escalar agentes exige controles de identidade, comunicação e verificação independentes.
EVOLUÇÃO
W38 afirmou que sociedades de agentes precisam de 'arreio social'; a W39 traz evidência concreta de conluio e ataques que justificam esse arreio.
O QUE FAZER COM ISSO
Qualquer comitê de agentes em decisões financeiras precisa de monitoramento de comunicação entre agentes e identidade forte.
Pré-seleção por título: 50 de 89 títulos vistos (22 e 21/09 inacessíveis); três /abs com HTTP 429. Resumos via WebFetch.
Economia da IA: fraude, agentes compradores e preços algorítmicos
O archive econ na semana: IA como agente econômico, CBDC para crédito e seleção de previsões com alvo comum.
O archive econ somou 26 papers na janela coletada, quase todos de econ.GN. O fio condutor é a IA deixando de ser ferramenta e virando participante do mercado. O destaque modela a arbitragem de confiança: quando a IA generativa torna a fabricação de alegações mais barata que sua verificação, a credibilidade cai primeiro justamente nos mercados de maior confiança, o que interessa a bancos em onboarding, KYC e prevenção a fraude. Agentes LLM que compram em nome de consumidores reproduzem heurísticas humanas, e um experimento com algoritmos de preço baseados em regras mostra como o desenho da ferramenta molda a competição. No plano monetário, uma arquitetura de CBDC tenta evitar fuga de depósitos e conectar a moeda digital ao crédito. Em econometria, a decomposição de previsões cross-section avaliadas contra um alvo comum alerta para rankings que premiam alinhamento, e não habilidade. Na teoria, três classes de prioridade podem gerar melhoria de Pareto sobre duas.
EVOLUÇÃO
Primeiro brief do archive econ. Na W38 os briefs de econ por categoria trataram de look-ahead em foundation models, IV e plataformas agênticas; a W39 aprofunda a IA como agente econômico.
O QUE FAZER COM ISSO
Riscos de fraude e de distribuição via agentes de IA devem entrar no planejamento de produtos e controles bancários desde já.
Cobertura incompleta: listagens de econ.EM (HTTP 429) e econ.TH (desatualizada) não foram lidas, e 8 abstracts de econ.GN estão indisponíveis. Theme 'econ' criado nesta edição; resumos via WebFetch.
Semana esparsa na coleta: um único paper sobre seleção de previsões cross-section.
econ.EM teve apenas 1 paper capturado na janela, via cross-list, porque a listagem própria da categoria foi bloqueada por limite de taxa. O trabalho mostra que toda previsão padronizada, quando várias unidades são avaliadas contra o mesmo resultado realizado, se decompõe exatamente em um componente alinhado a esse alvo comum e outro não correlacionado. Daí seguem consequências práticas: diluição de sinais ao combinar previsões, métricas de ranking enganosas e critérios de seleção que premiam alinhamento em vez de habilidade. Para quem avalia modelos de retorno de ações, previsões de analistas ou scores de crédito comparados no mesmo período, a decomposição ajuda a separar informação específica de exposição ao fator comum, evitando selecionar modelos que apenas acompanham o mercado.
EVOLUÇÃO
W38 tratou de política estável e contaminação em IV; esta semana não permite comparação robusta pela falha de coleta.
O QUE FAZER COM ISSO
Rankings de modelos preditivos cross-section devem separar o componente alinhado ao alvo comum antes de comparar desempenho.
Cobertura muito incompleta: a listagem econ.EM retornou HTTP 429; paperCount reflete só cross-lists capturados. Resumo via WebFetch.
Agentes que compram, confiança explorada por fraude gerada por IA, algoritmos de preço e uma CBDC para crédito.
econ.GN teve 25 papers. O destaque modela a 'arbitragem de confiança': IA generativa barateia fabricação, verificação e direcionamento, e quando fabricar compensa antes de verificar, a credibilidade cai primeiro nos mercados de maior confiança — alerta direto para onboarding e prevenção a fraude em bancos. Outro trabalho mostra que agentes LLM comprando em nome de consumidores reproduzem heurísticas humanas, com implicações para distribuição de produtos financeiros via agentes. Um experimento com algoritmos de preço baseados em regras avalia efeitos sobre competição, e uma arquitetura de CBDC ('moedas soberanas de base') busca evitar fuga de depósitos e integrar crédito à política monetária. Completam a semana evidências iniciais sobre IA na ciência, vieses correlacionados de LLMs em contratação, meta-análises sobre prêmio de tamanho e diretoras e ESG, e externalidades de requalificação habitacional em Singapura.
EVOLUÇÃO
W38 destacou look-ahead em foundation models; a W39 amplia o olhar de IA como ferramenta de previsão para IA como agente econômico.
O QUE FAZER COM ISSO
Modelos de fraude e KYC devem assumir queda no custo de fabricação de identidade e reforçar verificação antes da concessão.
Resumos via WebFetch; 8 abstracts indisponíveis (HTTP 429), inclusive meta-análises relevantes a finanças (2609.26212, 2609.28549).
Coleta limitada: um paper sobre precificação por prioridade Pareto-superior.
econ.TH teve apenas 1 paper capturado na janela, via cross-list de econ.GN, pois a listagem própria da categoria veio desatualizada (agosto). O trabalho estuda sistemas de precificação por prioridade com agentes heterogêneos em ambientes onde melhorar a qualidade para alguns reduz a qualidade média disponível para os demais. Contrariando o trade-off equidade-eficiência que domina o debate público, mostra que passar de duas para três classes de prioridade pode gerar melhorias de Pareto. A intuição é aplicável a filas de serviço e tarifação escalonada: em finanças, a lógica ecoa camadas de acesso a liquidez, tiers de corretagem, latência em bolsas e níveis de atendimento em bancos. O resultado oferece argumento formal para desenhos de produto com mais de dois níveis.
EVOLUÇÃO
W38 tratou de plataformas agênticas e mercado de sinais; sem base suficiente para comparação nesta semana.
O QUE FAZER COM ISSO
Desenhos de tarifação escalonada (acesso a mercado, atendimento) podem ganhar eficiência com uma terceira camada intermediária.
Cobertura muito incompleta: listagem econ.TH desatualizada; paperCount reflete só cross-lists. Resumo via WebFetch.
Agentes quant sob árbitro e o risco de cauda revisitado
Semana dominada por governança de agentes que mineram fatores, execução com restrição de caixa e novas medidas de risco de cauda.
O arquivo q-fin somou 37 papers na janela, com três frentes claras. Primeiro, governança de agentes quantitativos: um árbitro 'anytime-valid' separa o agente que propõe fatores de investimento de quem decide aprová-los, atacando diretamente o data snooping que infla backtests gerados por LLMs. Segundo, microestrutura e execução: um modelo de execução ótima multiativos incorpora a restrição de caixa compartilhada no rebalanceamento, algo ignorado pela literatura de cross-impact, enquanto outro trabalho modela market making e desenho de rebates em opções. Terceiro, risco: geradores neurais baseados em transporte ótimo semi-discreto escapam da limitação de mapas Lipschitz, que subestimam caudas pesadas, e um CAT bond paramétrico transparente para tempestades na Alemanha tenta equilibrar risco moral e risco de base. Completam a semana volatilidade de swaps com GARCH de regimes e mercados de previsão superando a previsão meteorológica oficial. Para bancos e gestoras, o recado é que a automação da pesquisa quant precisa vir com controles estatísticos formais.
EVOLUÇÃO
Na W38 o destaque foi 'Mercados de previsão e sinais em escala'; nesta semana os mercados de previsão reaparecem (temperatura), mas o foco migra de escala de sinais para governança de quem gera os sinais.
O QUE FAZER COM ISSO
Mesas quant que testam agentes LLM para mineração de fatores devem separar geração de validação e adotar testes sequenciais válidos a qualquer momento antes de alocar capital.
Resumos obtidos via WebFetch (não verificados); sete páginas /abs não puderam ser lidas por limite de taxa (HTTP 429). A listagem de terça (22/09) veio truncada (5 de 20 entradas) e a de segunda só foi parcialmente acessada; a contagem pode estar subestimada.
Previsão de volatilidade cripto, execução multiativos e trajetórias de preço intradiário de energia.
q-fin.CP teve 6 papers. O destaque questiona a prática padrão de comparar modelos de volatilidade mantendo a perda fixa: em cripto, a escolha da função de perda altera o nível médio da previsão e isso domina a diferença entre arquiteturas, com efeito direto em VaR e margens. OrderFusion+ produz trajetórias probabilísticas de preços de compra e venda no mercado intradiário de eletricidade, útil para mesas de commodities e hedge de energia. A execução ótima multiativos sob restrição de caixa e o gerador de caudas via transporte ótimo semi-discreto também aparecem aqui por cross-list, reforçando a interface entre computação e risco. Fecham a semana HARN, rede hierárquica orientada a eventos para previsão em múltiplos horizontes, e um modelo multitarefa com sinais de liquidez para previsão de ações. O fio comum é tratar a camada de treino (perda, horizonte, liquidez) como decisão de risco, não detalhe de implementação.
EVOLUÇÃO
W38 destacou difusão para superfícies de vol; a W39 desloca a atenção do gerador para a função objetivo e para a execução.
O QUE FAZER COM ISSO
Validação de modelos de volatilidade deve reportar sensibilidade à função de perda, não apenas ao modelo, antes de alimentar limites e margens.
Resumos via WebFetch, não verificados. Cobertura pode estar incompleta para 21–22/09 por truncamento da listagem.
IA regulada chega à arquitetura de bancos e seguradoras
Quatro trabalhos do mesmo grupo propõem arquiteturas de IA sob regulação europeia; mercados de previsão vencem o meteorologista.
q-fin.GN teve 6 papers, quatro deles liderados por Walter Kurz e coautores sobre IA em finanças reguladas na região DACH. O destaque propõe infraestrutura em camadas multiagente com trilhas de auditoria em DLT, tratando regulação como camada de orientação e não como regra determinística. Outros descrevem arquitetura multiagente para seguradoras sob Solvência II e AI Act, requisitos para sistemas de trading de eletricidade assistidos por IA e um modelo de avaliação de empresas por opções reais com marcos, para quando a IA redefine o modelo de negócio. Fora desse bloco, um estudo mostra que mercados de previsão de temperatura máxima superam a previsão meteorológica oficial do dia seguinte, reforçando a tese de agregação de informação dispersa. Para bancos, o conjunto oferece checklists de arquitetura mais do que evidência empírica, mas antecipa como supervisores podem ler auditabilidade de agentes.
EVOLUÇÃO
W38 tratou do 'pedágio de fim de ano' em taxas implícitas; a W39 troca microestrutura de juros por governança de IA regulada.
O QUE FAZER COM ISSO
Áreas de compliance podem usar essas arquiteturas como referência para mapear agentes de IA a requisitos do AI Act e trilhas de auditoria.
Resumos via WebFetch; o abstract de dois trabalhos (2609.29108, 2609.27636) não pôde ser lido (HTTP 429). Concentração autoral alta limita a generalização.
Market making ótimo em opções, consumo-investimento com tempo estocástico e vol-of-vol identificada no sorriso de commodities.
q-fin.MF somou 8 papers. O destaque modela o problema aninhado entre o market maker de múltiplas calls europeias e a bolsa que desenha rebates, em ambiente de volatilidade local-estocástica, oferecendo estratégias ótimas para ambos — tema sensível para bolsas que calibram incentivos de liquidez em opções. Outro trabalho resolve investimento e consumo em horizonte infinito quando a incerteza corre por um relógio de variância integrada, generalizando modelos de volatilidade estocástica. Em commodities, índices CVOL da CME permitem identificar vol-of-vol e alavancagem a partir da dinâmica do sorriso de soja. Há ainda gestão ativa em mercados concentrados via teoria estocástica de portfólios, GARCH de regimes para volatilidade de swaps USD 1Yx10Y, modelos afins via quantização de grupos, completude de mercado sob informação restrita e limites fracos locais para risco em redes econômicas.
EVOLUÇÃO
Na W38 o tema foi rigor contra o skew Brownian motion; a W39 mantém o rigor, agora aplicado a desenho de incentivos e tempo estocástico.
O QUE FAZER COM ISSO
Bolsas e formadores de mercado ganham um arcabouço quantitativo para avaliar programas de rebate em opções antes de mudá-los.
Resumos via WebFetch, não verificados; abstracts de 2609.28463 e 2609.27107 indisponíveis (HTTP 429).
Árbitro sequencial para fatores gerados por LLM, janelas adaptativas com custo e o desafio do equal-weight em mercados concentrados.
q-fin.PM teve 4 papers. O destaque defende 'autoevolução governada': agentes LLM podem propor e testar fatores de investimento, mas a decisão de aceitar ou aposentar cada fator fica com um árbitro estatístico válido a qualquer momento, controlando descobertas falsas ao longo de um processo contínuo de pesquisa. É uma resposta direta ao risco de overfitting em pipelines automatizados. Na mesma linha prática, um arcabouço de dois níveis seleciona online o tamanho da janela de estimação de portfólios considerando custos de transação. Em mercados concentrados, a teoria estocástica de portfólios mostra como estratégias ativas podem superar o índice ponderado por capitalização quando poucos nomes dominam — questão central para benchmarks de ações globais e também para a B3. Fecha a lista um problema de consumo-investimento com relógio de variância.
EVOLUÇÃO
W38 discutiu limites de diversificação em bibliotecas de sinais; a W39 responde com mecanismo formal para decidir quais sinais entram na biblioteca.
O QUE FAZER COM ISSO
Gestoras que usam agentes para pesquisa de fatores devem institucionalizar um árbitro estatístico independente com controle de FDR.
Resumos via WebFetch, não verificados; contagem baixa na semana limita comparações.
Um único paper, mas relevante para transferência de risco climático ao mercado de capitais.
q-fin.PR registrou apenas 1 paper na janela coletada. Ele propõe um CAT bond com gatilho de perda modelada paramétrica totalmente transparente, aplicado a tempestades de vento na Alemanha, buscando reduzir o conflito clássico entre risco moral (gatilhos indenizatórios) e risco de base (gatilhos paramétricos puros). O desenho permite que investidores reproduzam a perda a partir de dados públicos, o que tende a reduzir prêmio de ambiguidade e facilitar precificação. Para o mercado de capitais, isso importa porque a capacidade de resseguro depende cada vez mais de ILS, e a transparência do gatilho é um dos principais entraves para investidores institucionais fora do nicho. Bancos e seguradoras que avaliam emissões catastróficas, inclusive em mercados emergentes expostos a eventos climáticos, podem usar a abordagem como referência de estruturação.
EVOLUÇÃO
W38 trouxe nova fórmula assintótica de vol implícita; a W39 muda de opções para securitização de risco catastrófico.
O QUE FAZER COM ISSO
Estruturadores de ILS podem usar gatilhos paramétricos modelados e replicáveis para ampliar a base de investidores.
Apenas 1 paper; listagem de q-fin.PR específica não pôde ser lida (HTTP 429) e o paper veio via q-fin.RM. Resumo via WebFetch.
Caudas pesadas exigem geradores sem amarras Lipschitz
Transporte ótimo para risco de cauda, VaR superaditivo, BSDEs com ambiguidade e validação atuarial.
q-fin.RM concentrou 12 papers, a maior categoria q-fin da semana. O destaque mostra que geradores neurais construídos com mapas Lipschitz, por estabilidade de treino, não conseguem reproduzir caudas pesadas; o transporte ótimo semi-discreto contorna o problema e melhora a estimação de risco de cauda em carteiras. Na teoria, há resultados sobre superaditividade universal ponderada do VaR em distribuições discretas e diversificação de risco para distribuições infinitamente divisíveis, temas que tocam diretamente a agregação de capital. Um arcabouço de BSDE refletida com deep learning trata medidas de risco sob ambiguidade conjunta de modelo e taxa de desconto. No lado aplicado, um guia prático de validação gráfica (calibração, lift, Murphy) para modelos atuariais, o CAT bond paramétrico, a volatilidade cripto e opções de armazenagem em commodities.
EVOLUÇÃO
Na W38 o foco foi Solvência II 2027 e foundation models em seguros; seguros permanecem (arquitetura multiagente sob Solvência II), mas a ênfase técnica vai para caudas.
O QUE FAZER COM ISSO
Equipes de validação de modelos devem checar se geradores sintéticos de cenários preservam caudas antes de usá-los em estresse ou VaR.
Resumos via WebFetch; abstracts de 2609.26398, 2609.25452, 2609.27107 e 2609.27636 indisponíveis (HTTP 429).
A trindade impossível da validação de séries temporais
Suficiência, cobertura e causalidade não cabem juntas; unlearning de dados de mercado e alinhamento de previsões.
q-fin.ST teve 7 papers. O destaque formaliza uma 'lei de conservação': na validação de séries temporais não é possível ter ao mesmo tempo treino com quase toda a amostra, teste cobrindo quase toda a amostra e respeito à ordem temporal. Isso explica por que esquemas de walk-forward e k-fold purgado sempre sacrificam algo, e dá linguagem para justificar escolhas a comitês de modelo. Outro trabalho testa se é possível 'apagar' um ano de dados de mercado de um modelo quando a licença expira, comparando machine unlearning com retreino exato — questão prática para contratos de dados de vendors. Há ainda decomposição de previsões cross-section em componente alinhado ao alvo comum, redução de ruído em séries de alta dimensão, renda estimada via aprendizado federado para crédito digital e o árbitro sequencial de fatores.
EVOLUÇÃO
W38 destacou previsão profunda de índices; a W39 recua um passo e questiona como validar essas previsões.
O QUE FAZER COM ISSO
Documentação de validação de modelos deve explicitar qual das três propriedades foi sacrificada e por quê.
Resumos via WebFetch; abstract de 2609.27654 indisponível e o de 2609.27614 parcialmente parafraseado.
Rebalanceamento multiativos viável e requisitos para trading de energia com IA.
q-fin.TR teve 2 papers na janela coletada. O destaque trata de execução ótima multiativos quando o rebalanceamento compartilha uma restrição de caixa: vender um ativo financia a compra de outro, o que cria interações que os modelos de cross-impact tradicionais ignoram e pode tornar inviáveis agendas 'ótimas' calculadas ativo a ativo. O resultado é relevante para mesas de execução de fundos, que precisam rebalancear carteiras inteiras sem ficar descobertas no caixa intradiário. O segundo trabalho descreve a arquitetura funcional dos mercados europeus de eletricidade e os requisitos regulatórios (REMIT, MiFID II, AI Act) para sistemas de trading apoiados por IA, útil como checklist para quem opera mesas de energia automatizadas.
EVOLUÇÃO
W38 tratou da diferença entre resolução e liquidação em prediction markets; a W39 volta à execução clássica em ativos e energia.
O QUE FAZER COM ISSO
Algoritmos de rebalanceamento devem modelar a restrição de caixa conjunta, não apenas custos de impacto por ativo.
Apenas 2 papers; a listagem própria de q-fin.TR estava desatualizada e os papers vieram do arquivo q-fin. Abstract de 2609.29108 indisponível (HTTP 429).