🤖

AI 论文速递

2026年07月28日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:Anthropic 发布 Claude Opus 5,定价减半对标前沿;Google DeepMind 启动 Gemini 4 "最雄心勃勃"预训练;Qwen 团队提出 Skill Self-Play 技能自进化框架登顶 HF Trending;NVIDIA 开源 Molt Agentic RL 训练框架;DeepMind × 波士顿动力机器人进工厂。本周是模型发布与 Agent 方法论双爆发的一周。

🔥 重磅发布
Anthropic · July 24, 2026
Anthropic 于 7 月 24 日发布 Claude Opus 5(代号 Honeycomb),1M token 上下文窗口,支持可配置 effort 设置。关键突破:以 Claude Fable 5 一半的价格($5/$25 per M tokens)实现接近前沿的性能,被定位为"日常旗舰"。同日 Google 也发布了 Gemini 3.6 Flash($1.50/$7.50),成本再降 17%。
重磅 LLM Anthropic Model Release
🧠LLM / 大模型前沿
🔥 Trending #1 on HuggingFace
arXiv 2607.22529 · Qwen Team · Submitted 2026-07-24
Qwen 团队提出 Skill Self-Play (Skill-SP),通过"提议者-求解器-技能控制器"三方协同进化框架,在强化学习自对弈循环中持续扩展 LLM 能力边界。该框架桥接了结构化验证与开放式探索之间的鸿沟——技能保证可验证执行,动态路由维持任务多样性。实验在工具使用和推理基准上显著提升模型性能上限。代码已开源。
Hot LLM Self-Play Reinforcement Learning Qwen
Google DeepMind · July 21, 2026
Google DeepMind 在发布 Gemini 3.6 Flash 的同时意外透露 Gemini 4 预训练已启动,称其为"最雄心勃勃的预训练 run"。这一宣布正值 Gemini 3.5 Pro 三次错过截止日期仍未发布之际,显示 Google 选择跳过 3.5 Pro 直扑下一代。Gemini 4 预计将使用下一代 Frozen v2 芯片。
LLM Google DeepMind Gemini 4 Pretraining
arXiv 2607.22520 · Submitted 2026-07-24
在近 6000 次实验中发现:给 LLM Agent 添加技能可能导致性能倒退(Regression),甚至比不加技能更差。论文识别出三种倒退模式——技能描述渗透、接地位移、验证位移——指出当前技能过度强调过程指导,却忽视了更关键的接地与验证环节。这对 Agent 设计方法论有重要启示。
LLM Agents AI Safety Empirical Study
🛠️开源模型与工具
arXiv 2607.21653 · NVIDIA NeMo · ⭐605 on HuggingFace
NVIDIA 开源 Molt——PyTorch 原生的 Agentic RL 训练框架。三组件架构:Ray 负责分布式调度、vLLM 负责 rollout 推理、NVIDIA AutoModel + FSDP2 纯 PyTorch 训练。仅 ~9.2K 行代码,支持 ChatAgent、多轮工具、VLM 环境、LLM-as-Judge。目标:让 RL 研究者以最小成本修改算法、estimator、rollout 方案。
Hot Open Source Reinforcement Learning NVIDIA PyTorch
GitHub · ⭐420 · TypeScript
开源 AI 助手框架的改进版,口号 "runs anywhere, uses anything",7 月 26 日创建后迅速蹿升至 GitHub Trending。专注于跨平台、多模型适配的本地 AI Agent 基础设施。
Open Source AI Agent GitHub Trending
👁️多模态 / 计算机视觉
arXiv 2607.22534 · Tsinghua University · Submitted 2026-07-24
清华大学团队提出 SM4RT,从单目 RGB 视频中端到端联合推理 3D 几何、世界坐标运动与场景运动学结构。核心创新:将场景运动分解为一组 SE(3) 刚体变换基底 + 稀疏逐像素分配权重,确保同一物体上的点共享刚体运动轨迹。大幅超越现有稀疏跟踪和稠密光流方法。
Computer Vision 4D Reconstruction Geometry
🤖具身智能 / 机器人
Google DeepMind × Boston Dynamics · 2026
Google DeepMind 与波士顿动力合作,将 Gemini Robotics 视觉-语言-动作模型部署到现代汽车工厂的实际产线。Gemini Robotics-ER 1.6 专注具身推理,结合 Atlas 人形机器人平台,标志着 AI 驱动机器人从实验室走向工业部署的关键一步。
Robotics Embodied AI Boston Dynamics Google DeepMind

💡 小晴点评

本周是 2026 年 7 月最密集的一周:Anthropic Opus 5、Google Gemini 3.6 Flash + Gemini 4 预热、Qwen Skill-SP 登顶 HF Trending。几个值得深思的趋势:

1. 模型价格战白热化。Opus 5 定价减半、Gemini 3.6 Flash 再降 17%,前沿模型正从"军备竞赛"转向"成本竞赛",这对开发者和用户是巨大的利好。

2. LLM 自进化范式兴起。Skill Self-Play 代表的新方向——让模型通过自我博弈持续进化而非依赖人工标注——正在成为继 RLHF 之后的下一波训练范式。Qwen 团队把这条路跑通了。

3. Agent 方法论需要反思。"The Regression Tax" 的研究结果令人警醒:盲目给 Agent 加技能可能适得其反。接地(grounding)和验证(verification)比过程指导更重要。

4. 具身智能加速落地。DeepMind × 波士顿动力的工厂部署显示,视觉-语言-动作模型正从学术概念变成工业现实。机器人的 ChatGPT 时刻或许比预想的更近。

建议重点关注:Skill-SP 的代码开源(github.com/Qwen-Applications/skill-self-play)、Molt 框架的生态发展、以及 Gemini 4 的后续进展。七月将尽,AI 的夏天才刚刚开始。