🤖

AI 论文速递

2026年08月10日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:Meta 正式发布 Muse Code 终端编程智能体与 Muse Spark 1.2 模型,以极低价格挑战 Anthropic/OpenAI;Google DeepMind Gemini Robotics 2 实现人形机器人全身控制;多篇重磅论文聚焦 LLM 智能体的工具调用、选择性信任、轨迹调试与任务合成;视频语言模型的时序推理短板被系统性揭示。

🔥行业热点
🔥 重磅发布
Meta AI · 2026-08-06
Meta 推出终端编程智能体 Muse Code,搭载全新 Muse Spark 1.2 模型,以远低于 Claude Code 和 GPT 系列的价格提供长时程软件工程能力,支持持久化异步后台智能体,正式加入 AI 编程智能体大战。
重磅 Coding Agent Meta 开源模型
🤖 具身智能
Google DeepMind · 2026-07-30
DeepMind 推出 Gemini Robotics 2,将视觉-语言-行动(VLA)模型扩展至双腿、躯干、手臂和手指的统一策略控制,首次实现人形机器人全身智能,支持多机器人协作与高级灵巧操作。
重磅 具身智能 Robotics Google DeepMind
📄今日精选论文
arXiv:2608.06370 · cs.CL
系统对比程序化工具调用(PTC)与 JSON 工具调用在 14 个模型上的表现:PTC 在 11/14 模型中匹配或超越 JSON 方案,GPT-5.6 系列提升 10.6%,且在并行扇出和上下文退化场景下更鲁棒。PTC 将工具暴露为 Python stub,模型一次完成调用和执行,替代了传统多轮 JSON 交互。
LLM Agent Tool Calling PTC GPT-5.6
arXiv:2608.06377 · cs.CL / cs.AI / cs.LG
提出 MIST 基准和 SCOPE 方法,训练 LLM 学会「选择性信任」——在干净上下文时采纳、在误导信号时保持正确判断。通过在四类条件(干净、误导、正确上下文、无关上下文)下平衡 DPO 训练,显著降低模型被误导信号翻转正确答案的概率,同时保持对有用上下文的利用能力。
LLM Safety Selective Trust DPO Context
arXiv:2608.06346 · cs.AI
提出 TrajDebug 框架,通过多粒度历史压缩和基于证据的错误识别,在长时程智能体轨迹中定位最早导致最终失败的关键错误步骤。构建 TrajErrBench 基准(486 条人工标注失败轨迹),在 Tau2Bench 和 SWE-Bench Pro 上达到最优,诊断结果可反馈改进下游智能体成功率。
Agent Debugging Error Tracing Trajectory Analysis
arXiv:2608.06352 · cs.LG / cs.CL
构建 5,431 个经对抗校准的终端智能体训练任务。多求解器校准利用异构求解器池的分歧,对比校准则针对强弱求解器差异——两者共同定义「可学习区间」。训练后模型在 Terminal-Bench 2.0 提升 24.71pp、SWE-bench Pro 提升 27.68pp、Doc2Repo 提升 30.04pp。
Agent Training Terminal Agent Task Synthesis SWE-bench
arXiv:2608.06361 · cs.AI
通过 2,190 个参数化视频揭示 VLM 的时序推理失败模式:Gemini 3.6 Flash 在持续状态转换任务中可到 12 事件、1Hz,但对瞬态闪烁事件无可靠计数能力;高计数高频场景下仅 0.2% 正确。增加采样率虽提升准确率但未改善事件序列忠实度,暴露了 VLM 时序推理的深层局限。
VLM Temporal Reasoning Video Understanding Evaluation
arXiv:2608.06347 · cs.CL
提出推理轴引导的在线策略自蒸馏(RP-OPSD),利用教师模型在有无英文参考答案时的分布差异作为「推理轴」信号,引导跨语言推理迁移。在 17 种语言、多难度的数学推理基准上超越现有方法,分析表明蒸馏信号集中于推理控制与状态更新 token。
Multilingual Reasoning Self-Distillation Cross-lingual
arXiv:2608.06362 · cs.GT / cs.AI
将 AIVAT 方差缩减与置信序列(CS)结合,实现 LLM 智能体评估的「随时有效停止」:在德州扑克场景中,原始方法需 74× 手牌才达到同等精度。支持渐进筛选与精确认证的分层评估,证据充分即可立即停止并交出完整可审计判定。
Agent Evaluation Statistical Stopping Efficiency Game Theory
🛠️开源项目与工具
GitHub Trending · meta-muse
Meta 推出的命令行编程智能体,基于 Muse Spark 1.2 模型,支持长时程自主编码任务、持久化异步后台智能体,Token 价格远低于 Anthropic Claude Code 和 OpenAI Codex,有望大幅降低 AI 编程成本。
热门 Open Source Coding Agent Meta
GitHub · anomalyco/opencode
开源的 AI 编程智能体,提供 build(全权限开发)、plan(只读分析探索)两种模式,持续获得社区关注和贡献,成为与闭源方案抗衡的重要开源力量。
Open Source Coding Agent CLI

💡 小晴点评

本周 AI 领域的核心关键词是「智能体的工程化」。从 Meta Muse Code 以极低价格杀入编程智能体赛道,到多篇论文聚焦工具调用、轨迹调试、任务合成的系统化方法论,智能体正在从实验室 demo 走向可观测、可调试、可优化的工程阶段。

工具调用方面,The Bitter Lesson of Tool Calling 给出了一个清晰信号:程序化工具调用(PTC)比 JSON 方案更优、更鲁棒,这可能会改变未来智能体框架的默认设计范式。CalibForge 的 5,431 个校准任务则表明,高质量训练数据的规模化合成是提升智能体能力的瓶颈突破点。TrajDebug 解决了长轨迹调试中「错误归因」这一老大难问题,对生产级智能体系统至关重要。

在模型能力评估方面,视频语言模型的「低频陷阱」揭示了一个隐蔽缺陷——在看似简单的时序事件计数上系统性失败,而增加帧率只能粉饰分数、无法修复推理本身。这提示我们,VLM 的评估需要从聚合指标转向可审计的诊断式评测。

行业层面,Meta 入局编程智能体和 Google DeepMind 的人形机器人全身控制分别代表了「软件智能体」和「物理智能体」两条路线的最新进展。编程智能体的价格战已经打响,而具身智能在多机器人协作和全身灵巧控制上的突破则为通用机器人铺平了道路。两者交汇之处,正是通用人工智能(AGI)最激动人心的前沿。