2609.20784R·cs.CL18 de set. de 2026RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning Yan Yu, Zhengxi Lu, Yizhou Liu et al.