ANÁLISE EDITORIAL / 2026-09-05 — 2026-09-11
cs.SE na semana 37: agentes de código entre autoridade, testes e falsos bugs
O perigo da autoridade ambiente, testes escritos pela mesma trajetória que escreve o patch, e a reprodutibilidade tratada como engenharia de contexto.
Authority Is Not a String: A Capability-Scoped Harness for Prompt-Injection-Resistant Coding Agents mostra que ferramentas de agentes de código carregam autoridade ambiente: basta nomear um recurso para agir sobre ele, o que a injeção indireta de prompt explora. A proposta é um harness com capacidades de escopo explícito. Scanning the Harness: An Empirical Study of Supply-Chain Defects in AI Coding-Agent Configurations encontra defeitos de cadeia de suprimentos nas configurações de agentes. ExecCritic: Learn to Test, Test to Improve for Coding Agents alerta que, quando a mesma trajetória escreve o patch e o teste, os erros podem concordar e gerar falsa confiança. If It's Not Buggy, Don't Fix It: On the Dynamics of Iterative Bug-fixing with LLMs mostra LLMs “corrigindo” programas que não têm bug.
Na localização e resolução de issues, XAgent: eXecution-guided Agentic AI for Effective Localization and Resolution of GitHub Issues usa o comportamento em execução, e RepoNav: From Snippet Retrieval to File-Centered Repository Navigation for Code Agents navega pelo repositório a partir de arquivos. SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents limpa o SWE-Bench Pro de soluções vazadas. Reproducibility in the Age of Agentic AI: Context Engineering at the Timescale of a Codebase defende que práticas de pesquisa reprodutível (testes, histórico de commits, registros de decisão) funcionam como engenharia de contexto para agentes.
EVOLUÇÃO
Esta é a primeira edição da categoria.
O QUE FAZER COM ISSO
Separe quem escreve o teste de quem escreve o patch (ExecCritic: Learn to Test, Test to Improve for Coding Agents). Dê aos agentes capacidades explícitas em vez de acesso ambiente (Authority Is Not a String: A Capability-Scoped Harness for Prompt-Injection-Resistant Coding Agents).
Os estudos usam repositórios abertos e benchmarks públicos.