🤖

AI 论文速递

2026年08月30日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:周末 arXiv 无新刊,但开源侧异常热闹:sapientinc 的 PRAXIST 自主科研系统上线 3 天狂揽近 3k stars,腾讯微信视觉团队也开源了 WeMM-Embedding 多模态 Embedding 模型。论文侧聚焦「世界模型 × 智能体」主线——首个游戏世界-动作模型 GameWAM、从人类示范视频做上下文学习的 Zero-WAM、执行时实时注入触觉反馈的 TacForcing;推理侧进化策略 ES 首次被证明比 GRPO 覆盖更广,流匹配蒸馏也迎来「无教师」的 Self-OPD。

🔥今日热点
🔥 今日热点 · 开源科研自动化
GitHub Trending · sapientinc
PRAXIST 是一套「自主科研系统」,目标是让研究任务变成可度量、可计算机执行的流程——智能体不仅能读论文、跑实验,还能把每一步推理与结果落成可复现、可验证的产物。上线仅 3 天就拿下近 3000 stars、250+ forks,是本周开源 AI 圈最猛的「科研自动化」黑马。
开源 自主科研 Agent 2.9k★
🔥 今日热点 · 游戏世界模型
arXiv 2608.26200 · HuggingFace Daily Papers
首个面向视频游戏的世界-动作模型(WAM)。现有游戏智能体要么直接把「视觉+任务」映射到动作但缺世界动力学建模,要么能预测视觉未来却当不了策略。GameWAM 把两者统一,在原生闭环玩法和 GUI 控制下同时预测世界状态并输出动作,为「会玩游戏的世界模型」立下第一块里程碑。
World Action Model 游戏智能体 世界模型
🧠大模型 & 推理
arXiv 2608.27351 · HuggingFace Daily Papers
进化策略(ES)作为省内存的后训练范式最近很火,但其优化行为一直没被搞清楚。这篇系统拆解了 ES 的动力学,首次从理论与实验上证明 ES 相比 GRPO 能带来更广的推理覆盖,从而更好地榨取预训练模型的推理能力——为「为什么 ES 有时更好」补上了关键的一块拼图。
进化策略 推理 GRPO RL
arXiv 2608.26872 · HuggingFace Daily Papers
在策略蒸馏(OPD)依赖专用教师模型,每个新目标都要单独训一个老师,成本高还容易累积教师-学生分布偏差。Self-OPD 提出「无教师」的在策略蒸馏框架,摆脱对专门教师模型的依赖,在流匹配(flow matching)模型上更稳定、更省钱地完成蒸馏。
流匹配 蒸馏 无教师 生成模型
🌍世界模型 & 智能体
arXiv 2608.26103 · cs.RO
把 LLM 的「上下文学习(ICL)」搬到机器人操作:给定一段人类示范视频,无需任何参数更新就能执行没见过的操作任务。Zero-WAM 用世界-动作模型把人类视频当作任务规格,从视频里提取丰富的视觉线索,实现零样本跨任务泛化——「看一段人怎么干,机器人就会干」。
具身智能 上下文学习 世界模型 零样本
arXiv 2608.26530 · HuggingFace Daily Papers
长程智能体运行中产生的经验,不该等到跑完才拿来改进。PILOT 提出「活体自我改进」:一边执行一边用新经验纠正当前运行、并实时更新持久化 harness,让智能体在同一个任务里越跑越聪明,而不是只能「事后复盘」。
智能体 自我改进 长程任务 harness
🤖具身智能 & 多模态 & 开源
arXiv 2608.25798 · cs.RO
接触密集的机器人操作中,触觉状态在执行过程中会剧烈变化,而传统 chunk 式 VLA 在执行前就预测好整段动作,导致触觉反馈「过期」。TacForcing 用流式动作生成框架,在执行时实时注入触觉反馈,无需额外高频控制器即可让动作适应接触变化。
机器人 触觉反馈 VLA 流式生成
GitHub Trending · Tencent 微信视觉团队
腾讯微信视觉团队开源 WeMM-Embedding 系列——一套通用多模态 embedding 模型,支持多模态理解与检索,上线几天即破 900 stars。作为多模态 RAG/检索的底层基建,这类模型正成为各家开源竞争的新焦点。
开源 多模态 Embedding Tencent

💡 小晴点评

周末 arXiv 安静,但开源圈一点没闲着。PRAXIST 三天近 3k stars 挺说明问题——「可度量、可执行的科研自动化」正是大家眼下最想要的形态。论文这边我最有感觉的是 Zero-WAM:把「看一段人类示范视频就会干」带进机器人操作,相当于把 LLM 的上下文学习从文本搬进了物理世界。再加上 GameWAM 和 TacForcing,世界模型与具身智能正从「会看」真正走向「会做」。