📄前沿论文
arXiv:2608.05987 · HuggingFace 🔥22
针对长程多轮 Agent 任务中稀疏奖励难以追溯关键决策的问题,提出递归式 turn-level 信用分配方法。通过聚合 token 级 teacher-student log-prob 差异,在 log-odds 空间递归更新贝叶斯信念状态,无需训练额外 Critic 网络。
LLM
强化学习
AI Agent
arXiv:2608.01827 · 北大 + 华为云 + HKUST(GZ)
指出现有多模态搜索 Agent 的架构缺陷——视觉仅附加在输入或输出端,而非贯穿搜索过程。提出 Vision-in-the-Loop 范式,让视觉信号全程参与搜索决策,显著提升知识密集型开放世界任务的推理深度。
多模态
VLM
AI Agent
arXiv:2608.03979
将多模态 Agent 从静态图像扩展至连续视频流,要求密集时空定位与开放网络探索相结合,标志着多模态深度搜索进入视频时代。
多模态
视频理解
AI Agent
arXiv:2608.02990
提出面向机器人操控的解耦视频 VAE,以高压缩率实现优于 SOTA 2dB PSNR 的重建质量,并支持更精细的动作控制,为具身智能的视频表征学习提供新思路。
具身智能
机器人
视频生成
arXiv:2608.00146 · Google
Google 推出基于 Gemma 的扩散语言模型。两阶段训练管线仅消耗原 AR 模型不到 10% 的训练 token 预算,通过 SFT 教会模型双向去噪,开辟了扩散模型在文本生成领域的新路径。
LLM 架构
扩散模型
Google
💡 小晴点评
本周 AI 领域呈现出三个清晰趋势:
1. AI Coding Agent 大战全面打响。Meta Muse Code 以 Claude Code 四分之一的价格入局,加上 Grok Build 和 OpenCode(19.5 万星)的开源碾压,终端编码 Agent 正从「辅助工具」进化为「自主工程师」。谁能把 Agent Loop 做得更稳、更便宜,谁就赢得开发者。
2. 开源模型的性价比竞赛白热化。DeepSeek V4-Flash 以 MIT 协议和 $0.14/M 的价格,让「百万 token 上下文」不再是奢侈品。Kimi K3 开源权重、Qwen3.8-Max 紧随其后——中国团队的开放策略正在重塑全球 LLM 供给格局。
3. Agent RL 的基础问题受到重视。AgentOPSD 解决的信用分配问题,本质上是让 Agent 在 50 步任务中「知道哪两步真正起了作用」——这是从「能跑通」到「跑得好」的关键跃迁。DeepVoyager-VL 和 Video-DeepResearch 则将多模态 Agent 推入视觉深度搜索的新阶段。
4. 监管压力持续上升。EU AI Act 高风险义务 8 月 2 日全面生效,白宫 8 月 4 日召集 Meta/Anthropic/Google/OpenAI 讨论 rogue AI agent 安全问题——技术狂奔与治理博弈的张力在 2026 年夏天达到新高。