SAF-OPD: Stable Advantage Fusion for On-Policy Distillation Paper • 2607.29209 • Published 25 days ago • 34
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Paper • 2608.05987 • Published 19 days ago • 100
OPD-V: Visual On-Policy Self-Distillation with Modality Balance Paper • 2608.05131 • Published 19 days ago • 13