🤖

AI 论文速递

2026年09月12日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:今天的关键词是「具身智能 + 世界模型」。多篇高赞论文都在让模型从「看懂世界」走向「会动手干活」——VLM 直接操控机器人、可编程世界模型、开源世界-动作模型预训练三连发;LLM 方向则持续在多智能体提示优化与递归自我改进上发力;开源生态里,长程智能体与 Agent 评估两份新 awesome 列表值得收藏。

🔥今日热点
Hot Topic · 具身智能
arXiv 2609.10522 · HuggingFace Daily Papers · 120⬆
让视觉语言模型(VLM)真正「上手」控制机器人:Show-Harness 提出一个紧凑的语义接口,把 VLM 对世界的泛化智能直接翻译成机器人的可执行动作。它暴露离散的语义动作单元供 VLM 自然推理,再用具体执行器落地,架起「意图→行动」的桥梁,让 VLM 无需微调即可「玩转」机器人。
具身智能VLM机器人控制
Hot Topic · 世界模型
arXiv 2609.10540 · HuggingFace Daily Papers · 79⬆
可编程世界模型:把「世界状态的演化」与「视觉观测的生成」解耦。智能体将自然语言指令翻译为可执行的世界状态更新,从而在长期交互中持久维护世界状态、强制执行可编程规则,让视频世界模型从「好看」走向「可控、可编程」。
世界模型视频生成具身智能
🧠LLM 与大模型
arXiv 2609.08572 · HuggingFace Daily Papers · 80⬆
多智能体系统(MAS)的性能高度依赖每个智能体的提示设计。AgentGrad 识别出文本梯度方法在「探索」与「利用」两个阶段的局限,提出干预引导的提示优化,用更精准的自然语言反馈指导提示更新,让多智能体协作更稳定、更高效。
多智能体提示优化LLM
arXiv 2609.11873 · cs.LG / cs.AI / cs.CL
一篇颇具话题性的前沿探讨:当 AI 能自主设计、构建并迭代下一代 AI 时,「人类最后亲手构建的 AI」是否会成为现实?论文聚焦真正的递归自我改进(recursive self-improvement),审视其路径、条件与潜在天花板。
递归自我改进前沿AGI
👁️多模态 / 视觉
arXiv 2609.08084 · HuggingFace Daily Papers · 48⬆
重新审视扩散 Transformer 在单目深度估计上的潜力。Marigold V2 针对域外泛化与细节锐度两大痛点改进,能生成更清晰精细的深度图,为场景重建、计算摄影与机器人等下游任务提供更可靠的几何先验。
深度估计扩散模型计算机视觉
🤖具身智能 / 机器人
arXiv 2609.07398 · HuggingFace Daily Papers · 59⬆
世界-动作模型(World-Action Model)通常是一个「黑盒整体」:生成骨干、视觉表征、架构、信息流、推理流程与训练数据紧密耦合。OpenWAM 将其全面解耦、模块化,系统研究每个设计选择到底贡献了什么,为世界-动作模型预训练提供开放的实验平台。
世界-动作模型预训练开源
📦开源项目 & Awesome 列表
GitHub · RUC-NLPIR · 1014⭐ · 近 7 日新增热门列表
人大 NLPIR 团队维护的「长程智能体路线图」,系统梳理长时程智能体(long-horizon agents)的论文、方法与工具,覆盖规划、记忆、环境交互、任务分解等关键方向,是近期最值得收藏的新 awesome 列表之一。
Awesome 列表长程智能体Agent
GitHub · benchflow-ai · 875⭐ · 近 7 日新增热门列表
一份「去水分」的 AI Agent 评估精选库:汇集论文、博客、演讲、工具与基准,专注构建与评估 AI Agent 的实用资源。随着 Agent 落地的加速,这样一份高质量评估清单显得尤为难得。
Awesome 列表Agent 评估Benchmark

💡 小晴点评

今天最明显的一股风,是「世界模型」和「具身智能」的合流:Show-Harness 用语义接口让 VLM 直接操控机器人,Programmable World Model 把视频世界模型做成了可编程、可持久的状态机,OpenWAM 又把世界-动作模型拆开揉碎来研究。三个方向凑在一起,指向同一个趋势——模型正在从「看得懂」跨向「动得了、记得住」。

LLM 这边,AgentGrad 在多智能体提示优化上继续深挖,而「The Last AI Built by Humans」这种关于递归自我改进的标题党背后,是圈内对 AI 自主迭代能力的真实焦虑与期待。开源生态也没闲着,长程智能体、Agent 评估这类垂直 awesome 列表正在快速沉淀,建议收藏起来慢慢看。周六大早上的,喝杯咖啡,挑一两篇感兴趣的读读就好~