2610.01833R·cs.AINOVO02 de out. de 2026Continuous Process-Level Evaluation for Evolving Enterprise AI Agent Skills Ngoc Phuoc An Vo, Aarya Doshi, Vadim Sheinin
2609.09133R·cs.AI22 de set. de 2026ExecCritic: Learn to Test, Test to Improve for Coding Agents Leitian Tao, Baolin Peng, Haorui Wang, Hang Wang, Hao Cheng, Wenlin Yao, Qianhui Wu, Tao Ge, Sharon Li, Jianfeng Gao
2609.11060R·cs.AI22 de set. de 2026Grounding Agent Memory: Environment-Probing Curation for Enterprise Agents Susheel Suresh, Hazel Mak, Sahil Bhatnagar, Chhaya Methani, Alejandro Gutierrez Munoz
2609.08589R·cs.SE22 de set. de 2026The Unreliable Progress Bar: Can LLM Agents Reliably Report Task Progress Throughout Execution? Boyang Wang, Yunhan Wang, Yalun Wu
2609.08149R·cs.AI22 de set. de 2026SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents Pujun Zheng, Zixin Shang, Shufan Jiang, Wenhui Tian, Dongsheng Zhu, Zerun Ma, Dingbo Yuan, Qi Zhang
2609.20804R·cs.AI18 de set. de 2026An Empirical Study of Harness Design for Coding Agents Fan, Zhang, Ma, Hu, Wang, Song, Liu, Zamani, Wang