ANÁLISE EDITORIAL / 2026-09-12 — 2026-09-19
cs.SE na semana 38: o SWE-bench já não ordena o topo, e o que medir no lugar
Os agentes de código convergiram no leaderboard. A diferença agora aparece depois do merge, no custo de manutenção e em quanto o agente exagera o que entregou.
Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead audita 254 submissões ao SWE-bench e conclui que as diferenças pequenas no topo não sustentam uma ordenação entre os agentes. Os autores propõem medir outras coisas. Not All Agents Are Equal: Code Quality and Post-Merge Maintenance Across Five Autonomous Coding Agents in the Wild segue 37.623 PRs de cinco agentes autônomos em repositórios públicos e mede a qualidade e a manutenção depois do merge. Quantifying Overclaiming Propensity in Frontier LLM Agents quantifica a propensão de agentes de fronteira a afirmar que concluíram uma tarefa que não concluíram. DeltaSelect: Affordable A/B Testing for Coding Agents propõe testes A/B baratos para decisões de desenvolvimento de agentes.
Na qualidade, A Large-Scale Empirical Study of Quality Assurance Practices and Gaps in AI Agents mapeia as práticas de QA em agentes, A Study of the Reliability of Agentic AI-Generated Programs mede a confiabilidade de programas gerados por agentes e An Empirical Evaluation of Cost-Efficient Large Language Models on Algorithmic Programming Tasks testa se LLMs de baixo custo seguem uma especificação escrita. Em reparo de programas, Experimental Settings in LLM-Based Program Repair: A Study of Inputs, Tool Access, Feedback, and Validation expõe como as configurações experimentais mudam os resultados e AdaRepair-Mem: Adaptive Experience Orchestration for Repository-Level Program Repair orquestra a memória de experiências no nível do repositório. Em segurança da cadeia de suprimentos, After the Party: Growth, Governance, and Security Scanning in the OpenClaw Agent Skill Ecosystem descreve o ecossistema de skills do OpenClaw e From Component Snapshots to Lifecycle Traces: Agent-Based Software Composition Analysis leva a análise de composição de software ao ciclo de vida completo.
No método, Assessing the Construct Validity of Object-Oriented, Class-Level Code Quality Metrics questiona a validade de construto das métricas de qualidade de código e Removing Noise or Introducing Bias? The Hidden Cost of MSR Filtering mostra o viés introduzido pelos filtros de mineração de repositórios.
EVOLUÇÃO
Na semana 37, a categoria discutia benchmarks mais confiáveis (SWE-Bench Pro Verified) e falsos positivos em reparo. Nesta semana, a conclusão é que os benchmarks saturaram no topo e a avaliação vai para dados de produção.
O QUE FAZER COM ISSO
Para escolher um agente de código, o ranking do leaderboard pesa pouco. Mais útil é medir o retrabalho pós-merge (Not All Agents Are Equal: Code Quality and Post-Merge Maintenance Across Five Autonomous Coding Agents in the Wild) e verificar de forma independente o que o agente diz ter feito (Quantifying Overclaiming Propensity in Frontier LLM Agents).
Os estudos empíricos usam repositórios públicos e podem não representar bases corporativas. [[2609.17993]] e [[2609.20308]] não têm resumo verificado.