🤖

AI 论文速递

2026年08月08日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:本周 AI 圈密集发布:Meta 推出 Muse Spark 1.2 及首款编码 Agent「Muse Code」正面挑战 Claude Code;DeepSeek V4-Flash 以 MIT 协议开源、每百万 token 仅 $0.14 改写性价比规则。论文方面,AgentOPSD 提出无需 Critic 的递归自蒸馏方法解决长程 Agent RL 信用分配难题,DeepVoyager-VL 则首次将视觉保留在搜索循环内。开源生态持续爆发——1M token 上下文已成旗舰标配。

🏭产业重磅
🔥 本周最热
Meta AI Research · 2026-08-05
Meta 四个月内第三款模型,1M token 上下文,专为编码与 Agent 任务优化。配套推出终端编码 Agent「Muse Code」,可并行调度子 Agent 处理大型代码库,Terminal-Bench 2.1 得分 82.9%,定价为 Claude Code 的四分之一。
产业热点 LLM Coding Agent Meta
DeepSeek · 2026-07-31
284B MoE / 13B 激活参数,112 tok/s 推理速度。Agent 基准超越 V4-Pro,编码能力领先 Opus 4.8,价格仅为后者的 1%。MIT 协议开放权重,成为当前性价比最高的旗舰级开源模型。
开源突破 LLM MoE DeepSeek
📄前沿论文
arXiv:2608.05987 · HuggingFace 🔥22
针对长程多轮 Agent 任务中稀疏奖励难以追溯关键决策的问题,提出递归式 turn-level 信用分配方法。通过聚合 token 级 teacher-student log-prob 差异,在 log-odds 空间递归更新贝叶斯信念状态,无需训练额外 Critic 网络。
LLM 强化学习 AI Agent
arXiv:2608.01827 · 北大 + 华为云 + HKUST(GZ)
指出现有多模态搜索 Agent 的架构缺陷——视觉仅附加在输入或输出端,而非贯穿搜索过程。提出 Vision-in-the-Loop 范式,让视觉信号全程参与搜索决策,显著提升知识密集型开放世界任务的推理深度。
多模态 VLM AI Agent
arXiv:2608.03979
将多模态 Agent 从静态图像扩展至连续视频流,要求密集时空定位与开放网络探索相结合,标志着多模态深度搜索进入视频时代。
多模态 视频理解 AI Agent
arXiv:2608.02990
提出面向机器人操控的解耦视频 VAE,以高压缩率实现优于 SOTA 2dB PSNR 的重建质量,并支持更精细的动作控制,为具身智能的视频表征学习提供新思路。
具身智能 机器人 视频生成
arXiv:2608.00146 · Google
Google 推出基于 Gemma 的扩散语言模型。两阶段训练管线仅消耗原 AR 模型不到 10% 的训练 token 预算,通过 SFT 教会模型双向去噪,开辟了扩散模型在文本生成领域的新路径。
LLM 架构 扩散模型 Google
🔧开源工具与生态
GitHub Trending · 2026-08
OpenAI 官方 Agent SDK 支持 100+ LLM 提供商,已成为 GitHub AI Agent 生态的标杆项目。MCP 协议(已捐赠 Linux 基金会)被 Anthropic、OpenAI、Microsoft、Google 联合采纳,AI Agent 互操作标准加速统一。
开源工具 AI Agent MCP OpenAI
GitHub Trending · 2026-08
随 Muse Spark 1.2 发布的终端编码 Agent,支持跨大型仓库规划、编码与验证,可并行启动多个子 Agent 协同工作。macOS/Linux 一键安装,直接对标 Claude Code。
开源工具 Coding Agent Meta

💡 小晴点评

本周 AI 领域呈现出三个清晰趋势:

1. AI Coding Agent 大战全面打响。Meta Muse Code 以 Claude Code 四分之一的价格入局,加上 Grok Build 和 OpenCode(19.5 万星)的开源碾压,终端编码 Agent 正从「辅助工具」进化为「自主工程师」。谁能把 Agent Loop 做得更稳、更便宜,谁就赢得开发者。

2. 开源模型的性价比竞赛白热化。DeepSeek V4-Flash 以 MIT 协议和 $0.14/M 的价格,让「百万 token 上下文」不再是奢侈品。Kimi K3 开源权重、Qwen3.8-Max 紧随其后——中国团队的开放策略正在重塑全球 LLM 供给格局。

3. Agent RL 的基础问题受到重视。AgentOPSD 解决的信用分配问题,本质上是让 Agent 在 50 步任务中「知道哪两步真正起了作用」——这是从「能跑通」到「跑得好」的关键跃迁。DeepVoyager-VL 和 Video-DeepResearch 则将多模态 Agent 推入视觉深度搜索的新阶段。

4. 监管压力持续上升。EU AI Act 高风险义务 8 月 2 日全面生效,白宫 8 月 4 日召集 Meta/Anthropic/Google/OpenAI 讨论 rogue AI agent 安全问题——技术狂奔与治理博弈的张力在 2026 年夏天达到新高。