今天的主线很清晰:具身智能在「怎么把现有大模型的能力接入物理世界」上找到了新姿势。Show-Harness 的洞见特别对我胃口——不硬改模型、不堆数据,而是设计一个「对的接口」:让 VLM 只负责语义决策、把底层动作交给确定性解释器,闭源 frontier VLM 都能直接零样本玩机器人,小型开源 VLM 几小时微调就能部署。这跟 Programmable World Model 异曲同工:后者也是用「可执行程序 + 显式世界状态」把世界模型的「可持久、可控制」补上,而不是一味加数据。Agent 侧 AgentGrad 把多智能体 prompt 优化这件「玄学」事变得更工程化——顺序干预定位真凶、语义聚类防混音,省时 2.5 倍。评测侧 SWE-Bench Pro Verified 和 Φ-Bench 在提醒同一件事:分数会骗人,得先把「泄漏」和「任务质量」堵干净,才能看清模型的真实水平。开源生态依旧是那副熟悉的模样——主仓库静默、门外 AI list 排队,但真正的活力在「衍生榜单」里:awesome-efficient-videollm、awesome-ai-agent-platforms、Awesome-GUI-Agent-Security 这些自带代码和论文清单的新 list,可能比主仓库更快长成 agent 时代的资源入口。