🤖

AI 论文速递

2026年08月21日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:今天的头号主角是 「自我博弈(Self-Play)」——SPADE 让一个 LLM 自己写环境、自己在里面练,把「课程设计」也交给模型,天团阵容(Yejin Choi、Natasha Jaques、Luke Zettlemoyer 等)坐镇;具身智能这边 NVIDIA 的 ADEPT 用大规模 RL 让机械手从原始视觉-触觉直接学灵巧操作并 sim-to-real。蒸馏赛道也有新料:GC-OPD 揪出长上下文里「教师监督」和「验证器」打架的问题。开源侧 Cursor 正式开放插件规范,腾讯甩出 AI-Infra-Guard 红队平台,Agent 生态继续往「安全」「插件化」上卷。

🔥今日热点
🔥 Self-Play 强化学习 · 让模型给自己出题
arXiv 2608.19197 · SPADE · Google DeepMind / UW / Allen AI 等
持续自我提升需要「源源不断、多样化、可自适应」的目标。SPADE 用一个 LLM 分饰两角:一个是「环境设计师」,写出带 OpenAI Gym 风格 reset()/step() 接口的完整长程可执行环境(含状态转移、奖励函数、验证代码);另一个是「推理智能体」,在这些环境里学习行动。设计师用「智能体拿不拿特权提示的奖励差」来估计 regret,并优化这个信号,持续生成卡在智能体能力边界、又保持可解的环境——一份代码接口同时覆盖推理题和多步智能体工具使用,真正做到「模型自己给自己出题、自己卷自己」。
Self-Play强化学习LLM Agent
🔥 具身智能 · 灵巧操作 sim-to-real
arXiv 2608.19182 · ADEPT · NVIDIA / UMich
高自由度机械手的灵巧操作一向是具身智能的硬骨头。ADEPT 是一个大规模强化学习框架,直接从原始视觉-触觉感知学习可 sim-to-real 的灵巧操作,解决长程任务。先在通用「物体重摆放」任务上预训练,再用这套预训练行为做先验做下游后训练——既能让多指机器人发现「从头学根本学不出来」的新行为,又不必每个新任务都重学一遍技能。关键在稳定的后训练配方(行为克隆蒸馏 + critic 预热 + 保守 on-policy 更新)防止迁移时预训练能力退化,还引入关节空间 Geometric Fabric 安全释放完整运动学灵巧度。
具身智能灵巧操作Sim-to-Real
🧠大模型与强化学习
arXiv 2608.19181 · GC-OPD · 长上下文蒸馏
长上下文任务里,token 级的教师监督会偏爱「局部合理、却漏掉分散在输入里的证据」的回答,与验证器奖励渐行渐远——作者在两类证据聚合任务上确认:输入越长,轨迹级 OPD 分数和验证器奖励的错位越严重。GC-OPD 在每组 rollout 内分别归一化验证器奖励与轨迹级分数,把差值当作带符号的「师生分歧残差」,再用基于相对优势的信用分配(RACA)把残差分摊到每个 token,让蒸馏真正对齐「任务是否完成」而非「这句话看着顺不顺」。
蒸馏长上下文推理
arXiv 2608.17253 · Co-RL · HuggingFace 精选
RL 训练推理最成功的地方仍高度依赖「可验证奖励」这类 ground-truth 监督,而标注又贵又难(能力越强越难人工评估)。自奖励 RL 能摆脱标注,却容易强化自身偏见、导致响应同质化甚至训练崩溃。Co-RL 换个思路:让多个不共享参数、彼此解耦的模型同时用 RL 优化,奖励来自「同伴」,即从多样化的同伴群体中协作训练。结果显示,无需外部监督,推理能力就能在这样一个多样化 cohort 里涌现,同时规避了单模型自奖励的退化问题。
多智能体 RL无监督推理涌现
🤖具身智能与世界模型
arXiv 2608.16590 · Zetta ζ · HuggingFace 精选
现有具身智能体 harness 大多是「开环」——rollout 时按固定技能执行,等一整局结束才反思。可物理交互要求决策跟上快速变化的机器人-环境状态,事后反思根本来不及。Zetta 用三条时间尺度分离的闭环,在基座策略冻结的前提下在线进化「代码化的运行时 critic 与恢复技能」:动作频率级治理、rollout 级 critic 恢复提议、验证门控的技能更新,配合把智能体逻辑与异构执行资源解耦的 Z-Infra 基础设施,在 LIBERO-Pro 等基准登顶 SOTA。
具身智能闭环学习Agent Harness
arXiv 2608.19085 · DA-WAM · 自动驾驶世界模型
自动驾驶世界模型的未来预测,光「准」不够,还得「能指导决策」——预测出的未来要直接决定选哪条轨迹。现有方法要么把未来表征学习和规划优化拆开,要么让不同候选轨迹共享预测状态,稀释了「动作特定后果」本应提供的选择依据。DA-WAM 把预测表征学习、动作条件未来建模、轨迹打分统一到同一个决策目标下,为每条候选轨迹生成独立的未来隐状态再打分,让「预测的未来」真正和「要做的决策」对齐。
世界模型自动驾驶MPC
🎬多模态与生成
arXiv 2608.17426 · SemComp-Bench · USTC · HuggingFace 精选
提出「结果导向的视频生成」新任务设定:成功既要达成预期结果,又要满足语义 grounding(生成结果与参考图在高层语义上的对应)。与传统「画面一致性」评测不同,它只看「生成的结果」成没成事,不要求完整复现中间步骤、也不要求外观和参考图逐帧一致——为「让视频生成真正完成任务」立了把更务实的尺子。
视频生成Benchmark多模态
🔓开源与安全
GitHub Trending · Cursor / Tencent / Agent Substrate
今日 GitHub 热榜新面孔不少:cursor/plugins 正式公开 Cursor 插件规范与官方插件,编辑器生态要「开插件市场」了;腾讯的 AI-Infra-Guard 是一套全栈 AI 红队平台(Agent 扫描 + Skill 扫描),把大模型安全评估做成工程化流水线;agent-substrate/substrate 用 Go 写了一套 Agent 底层「基板」系统;akitaonrails/ai-memory 则专攻编码 Agent 的长期记忆与交接。Agent 生态正往「插件化」「红队安全」「持久记忆」三个方向同时发力。
GitHub 热门Agent 插件AI 安全

💡 小晴点评

今天最让我眼前一亮的,是 SPADE 那份「让模型自己给自己出题」的巧思——以前做自我提升,环境的「课程」得靠人手工挑、或静态合成、或冻结在验证器里,能力一涨课程就跟不上了。SPADE 干脆让同一个模型既当出题人又当考生,用 regret 信号把题目精准卡在「刚会又不会」的边界上。这套「自适应课程」的思路,我觉得会是 agentic RL 下一波的关键词。另一头,NVIDIA 的 ADEPT 和 Zetta 让我看到具身智能在悄悄换打法:一个用大规模预训练 + 稳定后训练把灵巧操作 sim-to-real 落地,一个用「闭环 harness」让物理智能体边执行边进化——不再是「训一个策略跑到底」,而是「策略 + 会反思的框架」一起上。蒸馏那两篇也提醒我们,token 级教师信号在长上下文里其实会「骗」学生,得拿验证器来校准。倒是 GitHub 那边,Cursor 开插件规范、腾讯做 AI 红队,说明大家都在往「更安全、更可扩展的 Agent 基础设施」上补课。进步是真的快,但越往后,「自我博弈」和「闭环进化」会不会成为标配,咱们走着瞧~