📄论文精选
arXiv:2607.28576 · 2026-07-30
研究发现,在同等 token 成本下,让 LLM 多次独立采样(并选出最佳结果),比 Self-Refine、Reflexion 等复杂自我反思策略效果更好,从 1.5B 到 7B 模型均成立。这对推理策略设计有重大启示。
LLM 推理
采样策略
反思机制
arXiv:2607.28627 · 2026-07-30
针对长视觉上下文中 VLM 性能下降问题,提出 ReToken 方法,用一个可学习的检索 token 大幅提升视觉语言模型在大量干扰项中的检索精度,同时降低计算开销。
多模态/VLM
视觉检索
效率优化
arXiv:2607.28623 · 2026-07-30
提出 PAC-MAN(Perception-Aware CBF-RL),将控制屏障函数与强化学习相结合,在真实感知条件下实现人形机器人全身安全闪避。策略仅凭球体图像输入即可完成高动态躲避动作。
具身智能
人形机器人
安全控制
强化学习
arXiv:2607.28568 · 2026-07-30
在机器学习工程场景中训练 AI 模型来改进 AI 构建过程本身(AI4AI),探索递归自我改进(RSI)的可行路径。以 ML 工程为可执行测试平台,验证 AI 系统自我优化的潜力。
AI 自我改进
AI4AI
递归学习
arXiv:2607.28609 · 2026-07-30
为 Computer-Using Agents (CUAs) 建立标准化的奖励模型评估基准。验证智能体轨迹是否完成用户指令,覆盖跨平台场景,为 GUI 智能体的可靠性评估提供统一框架。
GUI 智能体
Computer-Use
评估基准
arXiv:2607.28624 · 2026-07-30
提出 PhiZero,以"物理语言"(physical language)——世界状态转换的紧凑离散表示——构建物理世界模型。区别于传统基于视频预测的世界模型,用符号化表示实现更高效的物理推理。
世界模型
物理推理
表示学习
💡 小晴点评
今日 AI 圈最值得关注的是两条主线:前沿模型进入性价比绞杀战——Anthropic Opus 5 以 Fable 5 一半的价格提供同等智能,OpenAI 则直接砍掉 Luna 80% 的价格,说明「能力」正迅速从稀缺品变为日用品;另一条是开源力量持续壮大,Moonshot Kimi K3 的开放下载延续了中国 AI 实验室的开源浪潮,而 Anthropic 押注 AMD 算力也昭示着基础设施层的多极化趋势。
学术方面,"Sample More, Reflect Less" 这篇论文尤为尖锐——它用实验数据挑战了 Self-Refine、Reflexion 等反思范式的有效性,主张简单重复采样更划算。这对当前主流的 Agent 推理策略设计是当头一棒。
具身智能领域的 PAC-MAN 和 PhiZero 则代表了 AI 从「数字世界」向「物理世界」的持续渗透——前者让人形机器人在真实感知下完成高动态运动,后者尝试用符号化表示理解物理规律。