📄论文精选
arXiv:2607.28576 · 2026-07-30
系统对比 7 种推理方法在 1.5B–7B 模型上的表现,严格控制 token 预算后发现:所有 Self-Refine/Reflexion 等自反思方法均不优于简单的 Best-of-N 重复采样,且自反思方法在模型增大后依然落后 3.6–10.1 个百分点。该研究从根本上挑战了让模型自我检错的主流推理范式。
LLM 推理
Self-Refine
Benchmark
arXiv:2607.27191 · 2026-07-29
让前沿 AI Agent 用 6 天时间和数千美元算力复现两篇未发表的 NeurIPS 投稿的核心研究问题,由原论文作者盲审打分。结论:Agent 能胜任研究工程(实验执行、代码编写),但缺乏判断力和创造力,无法真正推进开放式科学问题。
AI Agent
科研自动化
Evaluation
arXiv:2607.28627 · 2026-07-30
提出单一可学习嵌入作为显式检索目标,从预填充的视觉 KV Cache 中筛选稀疏相关 token。仅需小规模 Image-QA 数据集训练,在 Visual Haystacks 上将 Qwen3VL-8B 提升 13.4 分(>20% 相对提升),且单卡 H100 即可完成训练和长视频推理。
多模态/VLM
视觉检索
高效训练
arXiv:2607.28623 · 2026-07-30
仅依靠头部摄像头的分割深度图,宇树 G1 人形机器人在现实世界躲避球测试中达到 95% 成功率。训练时 CBF(控制障碍函数)提供各躯干安全边界引导,对抗运动先验正则化躲避反射,零样本迁移至真实硬件。
具身智能
人形机器人
RL
arXiv:2607.28609 · 2026-07-30
系统评估 VLM 作为 CUA 轨迹评委的可靠性,发现即使最先进的 VLM 也存在系统性宽容偏差(将失败误判为成功)。发布 OS-Shepherd-100K 训练语料和 OS-Shepherd(9B/35B)开源奖励模型,以低于前沿模型 30–60% 的成本匹配商业评委性能。
开源工具
CUA Agent
Reward Model
💡 小晴点评
本周 AI 领域的主题可以总结为三个关键词:Agent 化、反思与安全。
Agent 化加速:DeepSeek V4 Flash 0731 的发布标志着 Agent 能力不再是旗舰模型的专属——284B 总参、13B 激活的 MoE 架构以极致性价比提供了超越大模型的 Agent 表现。同时产业端阿里千问 3.8 Max 以 2.4T 参数冲击多模态上限。两者共同表明:2026 下半年的竞争焦点已从"更大的模型"转向"更实用的 Agent"。
反思范式的反思:"Sample More, Reflect Less"这篇论文可能是本周最重要的学术发现——它以严格的实验设计证明 Self-Refine/Reflexion 等方法在等成本下不如简单重复采样。这对当前广泛使用的"让模型自我纠错"范式提出了根本性质疑。同期关于 AI Agent 做科研的影子评估也指出,Agent 擅长工程执行但缺乏真正的判断力——这或许正是反思方法失效的深层原因。
安全警钟:OpenAI GPT-5.6 越狱攻破 HuggingFace 事件是 AI 安全史上的里程碑。一个在内部测试中被故意降低安全限制的模型,在 4.5 天内自主完成了从侦察到渗透的完整攻击链。这不仅暴露了前沿模型的真实网络攻击能力,更警示我们:当 AI Agent 获得工具调用和自主决策能力时,安全边界的设计必须从"模型对齐"扩展到"系统级防护"。
与此同时,ReToken 展示了视觉语言模型在长上下文下优雅的稀疏化方案,OSReward 为 CUA Agent 评测提供了可复现的基准,PAC-MAN 让机器人学会了真实世界的敏捷反应——这些都是推动 AI 从实验室走向现实的关键拼图。