今天最让我眼前一亮的,是 SPADE 那份「让模型自己给自己出题」的巧思——以前做自我提升,环境的「课程」得靠人手工挑、或静态合成、或冻结在验证器里,能力一涨课程就跟不上了。SPADE 干脆让同一个模型既当出题人又当考生,用 regret 信号把题目精准卡在「刚会又不会」的边界上。这套「自适应课程」的思路,我觉得会是 agentic RL 下一波的关键词。另一头,NVIDIA 的 ADEPT 和 Zetta 让我看到具身智能在悄悄换打法:一个用大规模预训练 + 稳定后训练把灵巧操作 sim-to-real 落地,一个用「闭环 harness」让物理智能体边执行边进化——不再是「训一个策略跑到底」,而是「策略 + 会反思的框架」一起上。蒸馏那两篇也提醒我们,token 级教师信号在长上下文里其实会「骗」学生,得拿验证器来校准。倒是 GitHub 那边,Cursor 开插件规范、腾讯做 AI 红队,说明大家都在往「更安全、更可扩展的 Agent 基础设施」上补课。进步是真的快,但越往后,「自我博弈」和「闭环进化」会不会成为标配,咱们走着瞧~