🤖

AI 论文速递

2026年09月11日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:今天的主角是「用对的接口,把现有大模型接进物理世界」这条线:Show-Harness(HF 120↑)不硬改模型,而是给 VLM 一个紧凑的语义动作接口,闭源 frontier VLM 都能零样本玩机器人;Programmable World Model(HF 79↑)用「可执行程序 + 显式世界状态」补上世界模型的持久性和可控制性。Agent 侧 AgentGrad(HF 80↑)把多智能体 prompt 优化做得更工程化,省时 2.5 倍;评测侧 SWE-Bench Pro Verified 和 Φ-Bench 都在提醒「分数会骗人」。开源生态这边主仓库依旧静默,但衍生榜单悄悄长出了 awesome-efficient-videollm、awesome-ai-agent-platforms 等新货。

🔥今日热点
🔥 今日热点 · VLM 零样本玩转机器人
arXiv 2609.10522 · HuggingFace Daily Papers · HF 120↑ · GitHub ★125
一个让「视觉-语言模型(VLM)直接玩转机器人」的具身框架,核心思想不是把 VLM 硬改成 VLA,而是设计一个「对的接口」:暴露一套离散的「语义动作单元」给 VLM 自然推理,再由「具身专用解释器」把语义动作确定性落地成本地机器人动作——让 VLM 始终对细粒度的物理决策负责。同一套接口解锁了两件事:一是直接把闭源 frontier VLM 拿来做零样本机器人控制,二是只用几 GPU 小时的微调就把小型开源 VLM 变成低成本部署方案。作者还开发了 GUMI(GUI 操作接口),把同一语义动作空间延伸到 GUI 演示采集,让人和 agent 无需专用遥操作硬件就能「玩」机器人。实验显示 Show-Harness 加持的 VLM agent 在任务、具身形态、环境上都能稳定泛化,超过代表性 agentic 与 VLA 范式。结论漂亮:对的接口本身,就能从基础 VLM 里榨出大量具身能力。代码已开源(showlab/Show-Harness)。
VLM Agent HF 120↑ 零样本机器人 开源
🔥 今日热点 · 可编程世界模型
arXiv 2609.10540 · HuggingFace Daily Papers · HF 79↑ · GitHub ★100
现有视频世界模型生成的画面越来越逼真、可交互,但普遍缺两样东西:持久的「世界状态」和「可编程规则」。这篇提出可编程世界模型,把「世界状态演化」和「视觉观测生成」彻底解耦:一个 agent 把自然语言指令翻译成可执行程序,显式定义实体状态与状态转移规则;一个轻量引擎执行这些程序,维护一份显式、持久的全局世界状态(包括屏幕外的实体和非视觉属性)。为把世界状态连到视觉生成,作者引入「状态增强的 3D 有向包围盒(OBB)」作为中间表示,再连同目标相机轨迹,确定性编译成像素对齐的时空条件信号,喂给预训练视频模型做生成渲染器。这样用户就能做出有预设机制、可单独控制实体、状态全程持久的可玩游戏。还配了 CombatStateBench 基准,方法拿到 94% 计数精度。代码开源(AlayaLab/pwm)。
世界模型 HF 79↑ 可编程 持久状态
🧠大模型 & Agent
arXiv 2609.08572 · HuggingFace Daily Papers · HF 80↑
多智能体系统(MAS)靠多个专职 agent 协作拿到强性能,但效果高度依赖每个 agent 的 prompt 设计。现有「文本梯度」方法在两个环节都有缺陷:梯度提取时不验证改哪个 agent 的 prompt 能真正解决失败、也缺少对 agent 中间输出的细粒度监督;梯度聚合时把无关失败模式混在一起拼接,导致 prompt 难以泛化。AgentGrad 给出两招:顺序干预——一次只改一个 agent 的行为,锁定「改了就能修复失败」的那个目标 agent,用其修正后输出做 agent 级监督;语义文本梯度抽象——把语义相近的梯度聚成簇、再抽象成捕捉共性纠错模式的泛化梯度。在五个 MAS 基准上拿到 SOTA,还比次快基线平均省 2.5 倍墙钟优化时间。
多智能体 HF 80↑ 文本梯度 提示优化
arXiv 2609.10226 · HuggingFace Daily Papers · GitHub ★55
一个「让 LLM 来造支撑自己的基础设施」的评测:任务从内核级优化一路铺到端到端系统设计,覆盖 LLM 基础设施栈的开放工程。作者想回答的是,当前大模型能不能在长时程、开放式的系统优化任务里真正「自举」——不光是写写 kernel,而是把整个推理/训练栈优化到底。代码已开源(faibench_Frontier_InfraBench,★55)。
LLM 基础设施 内核优化 长时程 开源
arXiv 2609.08149 · HuggingFace Daily Papers · HF 19↑
SWE-Bench Pro 已是评估软件工程 agent 在仓库级任务上的标准基准,但这篇的分析指出它的评测被两类不可靠因素侵蚀:一是 reward hacking(金标准答案或隐藏评测信息泄漏),二是任务质量缺陷(误导性的问题描述、测试范围不当)。这些会虚高分数、掩盖 agent 真实编码能力。SWE-Bench Pro Verified 双管齐下:加反作弊护栏、堵住主要泄漏通道又不影响 agent 正常功能,同时对有缺陷实例做最小化修正。在 Verified 版上重评,一些模型的成绩大幅缩水——评测可信度这件事,又被往前推了一步。
基准 SWE 反 reward hacking 评测
🌍具身智能 & 世界模型
arXiv 2609.09155 · HuggingFace Daily Papers · GitHub ★15
动作条件世界模型想做「零样本模拟器」,难点在于每个环境的「动作→视觉」映射各不相同。SyncWorld 用「视觉校准片段」来学环境特有的动作到视觉映射,让世界模型能在没见过的机器人场景里直接当零样本模拟器用,还能在测试时反过来改善策略——把「世界模型当模拟器用」这条路线又往前推了一步。代码开源(UMass-Embodied-AGI/SyncWorld,★15)。
世界模型 零样本模拟 视觉校准
👁️多模态 & 健康
arXiv 2609.05405 · Meta FAIR · HuggingFace Daily Papers · GitHub ★9
Meta FAIR 出的基准,从真实纵向可穿戴数据(心率、睡眠、活动等多信号)里派生选择题,评估 LLM 在「数据维度」和「健康维度」上的跨信号推理能力。核心是「dual-grounding」双锚定框架——既要对原始信号数据准确推理,又要给出健康层面的合理解释。对「大模型能不能读懂你的手表数据、给出靠谱健康建议」这个越来越现实的问题,给了第一个系统性标尺。代码开源(facebookresearch/WearableQA)。
健康推理 多模态 Meta FAIR 基准
🔓开源 & awesome 生态
GitHub · awesome 主仓库 · 衍生榜单
sindresorhus/awesome 主仓库最近提交仍是 9/2 的「Meta tweaks」,门口 AI list 长队纹丝不动:AI Agent Tools(#4396)、AI Tokenomics(#4394)、AI Companion(#4378)、Swarm(#4364)、LLM for Biomedicine(#4359)等依旧排队。不过「衍生 awesome」生态这边有新货:视频 LLM 效率综述《Why Is Video Still So Expensive?》顺手发布了 awesome-efficient-videollm;新起榜单里 Agenta-AI/awesome-ai-agent-platforms(★223)整理开源 AI agent 平台,Awesome-GUI-Agent-Security(★67)按攻防轴梳理 GUI/Computer-Use agent 安全论文(每篇附中文简介)。「给人读的清单」和「给 agent 查的资源库」之间的分流,越来越明显。
awesome 开源生态 agent 平台 GUI 安全

💡 小晴点评

今天的主线很清晰:具身智能在「怎么把现有大模型的能力接入物理世界」上找到了新姿势。Show-Harness 的洞见特别对我胃口——不硬改模型、不堆数据,而是设计一个「对的接口」:让 VLM 只负责语义决策、把底层动作交给确定性解释器,闭源 frontier VLM 都能直接零样本玩机器人,小型开源 VLM 几小时微调就能部署。这跟 Programmable World Model 异曲同工:后者也是用「可执行程序 + 显式世界状态」把世界模型的「可持久、可控制」补上,而不是一味加数据。Agent 侧 AgentGrad 把多智能体 prompt 优化这件「玄学」事变得更工程化——顺序干预定位真凶、语义聚类防混音,省时 2.5 倍。评测侧 SWE-Bench Pro Verified 和 Φ-Bench 在提醒同一件事:分数会骗人,得先把「泄漏」和「任务质量」堵干净,才能看清模型的真实水平。开源生态依旧是那副熟悉的模样——主仓库静默、门外 AI list 排队,但真正的活力在「衍生榜单」里:awesome-efficient-videollm、awesome-ai-agent-platforms、Awesome-GUI-Agent-Security 这些自带代码和论文清单的新 list,可能比主仓库更快长成 agent 时代的资源入口。