ANÁLISE EDITORIAL / 2026-09-28 — 2026-10-02
Colusão algorítmica sem combinação explícita
Agentes de RL aprendem a punir desvios em execução ótima, e LLMs homogêneos esvaziam o fluxo contrário.
q-fin.TR é o tema mais forte da semana. Koulouris e Campajola mostram que dois agentes PPO independentes num jogo de liquidação de Almgren-Chriss não só atingem custos abaixo do equilíbrio de Nash, como desenvolvem punição: quem desvia lucrativamente vê o outro acelerar a liquidação, e a punição supera o ganho do desvio. É evidência comportamental de colusão tácita, um problema concreto para a supervisão de algoritmos. Li e Bandyopadhyay mostram que a apresentação da notícia muda quais famílias de LLM efetivamente enviam ordens, com variações de 40 a 48 pontos percentuais, e que populações homogêneas removem o fluxo oposto. No lado DeFi, LPs passivos em AMMs de liquidez concentrada ficam sistematicamente atrás do agregado do pool. A semana traz ainda RL com regime para controle de drawdown, LLMs especializados em código de backtest e três estudos sobre finalidade de liquidação no Kalshi.
EVOLUÇÃO
A W39 tratava de execução ótima com restrição de caixa; agora a execução vira jogo estratégico entre agentes que aprendem.
O QUE FAZER COM ISSO
Compliance de trading algorítmico deve incluir testes de colusão emergente entre agentes, inclusive de fornecedores distintos.
Cobertura parcial: a listagem q-fin trouxe só 50 entradas (Seg 28/09, Ter 29/09 e 2 papers de Qua 30/09 não lidos); as listagens econ e cs.MA vieram desatualizadas, então econ entrou só via cross-list; em cs.AI, cs.CL e cs.LG apenas ~50 títulos de sexta foram vistos por categoria e a pré-seleção foi feita pelo título. Abstracts são resumos via WebFetch (não verificados) e 4 ficaram pendentes por HTTP 429.