SAF-OPD: Stable Advantage Fusion for On-Policy Distillation Paper • 2607.29209 • Published 15 days ago • 34
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Paper • 2608.05987 • Published 9 days ago • 94
OPD-V: Visual On-Policy Self-Distillation with Modality Balance Paper • 2608.05131 • Published 9 days ago • 12