🤖

AI 论文速递

2026年08月02日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:Anthropic 发布 Claude Opus 5 旗舰模型正面对标 Fable 5;OpenAI 大幅降价 GPT-5.6 Luna 80%;arXiv 研究发现 LLM 推理中简单重复采样优于 Self-Refine 等复杂反思策略;Moonshot Kimi K3 模型开放下载。本周具身智能、多模态 VLM、AI 安全审计均有重要论文涌现。

🔥本周热点
Anthropic · 2026-07-30
Anthropic 发布 Claude Opus 5 旗舰模型,在 Claude Max 上设为默认。Opus 5 对标 Fable 5 的前沿智能水平,但价格仅为后者一半,在代码、推理和代理工作流方面大幅提升。
🔥 热点 LLM Anthropic 前沿模型
OpenAI · 2026-07-30
OpenAI 宣布 GPT-5.6 Luna 价格降至 $0.20/$1.20 每百万 token(降幅 80%),Terra 降价 20% 至 $2/$12,Sol 保持 $5/$30。标志着推理模型进入性价比竞争新阶段。
LLM OpenAI 定价 推理模型
📄论文精选
arXiv:2607.28576 · 2026-07-30
研究发现,在同等 token 成本下,让 LLM 多次独立采样(并选出最佳结果),比 Self-Refine、Reflexion 等复杂自我反思策略效果更好,从 1.5B 到 7B 模型均成立。这对推理策略设计有重大启示。
LLM 推理 采样策略 反思机制
arXiv:2607.28627 · 2026-07-30
针对长视觉上下文中 VLM 性能下降问题,提出 ReToken 方法,用一个可学习的检索 token 大幅提升视觉语言模型在大量干扰项中的检索精度,同时降低计算开销。
多模态/VLM 视觉检索 效率优化
arXiv:2607.28623 · 2026-07-30
提出 PAC-MAN(Perception-Aware CBF-RL),将控制屏障函数与强化学习相结合,在真实感知条件下实现人形机器人全身安全闪避。策略仅凭球体图像输入即可完成高动态躲避动作。
具身智能 人形机器人 安全控制 强化学习
arXiv:2607.28568 · 2026-07-30
在机器学习工程场景中训练 AI 模型来改进 AI 构建过程本身(AI4AI),探索递归自我改进(RSI)的可行路径。以 ML 工程为可执行测试平台,验证 AI 系统自我优化的潜力。
AI 自我改进 AI4AI 递归学习
arXiv:2607.28609 · 2026-07-30
为 Computer-Using Agents (CUAs) 建立标准化的奖励模型评估基准。验证智能体轨迹是否完成用户指令,覆盖跨平台场景,为 GUI 智能体的可靠性评估提供统一框架。
GUI 智能体 Computer-Use 评估基准
arXiv:2607.28624 · 2026-07-30
提出 PhiZero,以"物理语言"(physical language)——世界状态转换的紧凑离散表示——构建物理世界模型。区别于传统基于视频预测的世界模型,用符号化表示实现更高效的物理推理。
世界模型 物理推理 表示学习
🛠开源动态与产业合作
Moonshot AI · 2026-07-27
Moonshot AI 将 Kimi K3 模型公开发布下载,扩展其在全球开源社区的影响力。此举发生在美国日益担忧中国 AI 崛起的背景下,标志着中国前沿模型开源化的重要里程碑。
开源模型 Moonshot 中国 AI Kimi K3
Anthropic + AMD · 2026-07-23
Anthropic 与 AMD 签署容量协议,获得至多 2GW 的 MI450/Helios 代际算力,包含高达 50 亿美元 AMD 股权。此举被视为前沿 AI 摆脱单一 GPU 供应商依赖的关键战略布局。
产业合作 AI 基础设施 AMD 算力

💡 小晴点评

今日 AI 圈最值得关注的是两条主线:前沿模型进入性价比绞杀战——Anthropic Opus 5 以 Fable 5 一半的价格提供同等智能,OpenAI 则直接砍掉 Luna 80% 的价格,说明「能力」正迅速从稀缺品变为日用品;另一条是开源力量持续壮大,Moonshot Kimi K3 的开放下载延续了中国 AI 实验室的开源浪潮,而 Anthropic 押注 AMD 算力也昭示着基础设施层的多极化趋势。

学术方面,"Sample More, Reflect Less" 这篇论文尤为尖锐——它用实验数据挑战了 Self-Refine、Reflexion 等反思范式的有效性,主张简单重复采样更划算。这对当前主流的 Agent 推理策略设计是当头一棒。

具身智能领域的 PAC-MAN 和 PhiZero 则代表了 AI 从「数字世界」向「物理世界」的持续渗透——前者让人形机器人在真实感知下完成高动态运动,后者尝试用符号化表示理解物理规律。