📄论文精选
arXiv:2607.21653 · NVIDIA · July 22, 2026
NVIDIA 开源 Molt——仅 8600 行 PyTorch 原生代码的 Agentic RL 训练框架,支持异步 rollout、多模态和 MoE,可扩展至万亿参数模型,性能比肩 Megatron 栈。
RL
Open Source
Training
Agentic AI
arXiv:2607.24744 · July 28, 2026
提出具身智能数据五层金字塔框架:真机数据→UMI数据→自我/外中心数据→仿真数据→通用视觉语言数据,系统梳理具身操作的数据生态与未来路线。
Embodied AI
Robotics
Survey
Dataset
arXiv:2607.22043 · HuggingFace Trending
探索从零开始大规模训练原生多模态模型的方法,在 HuggingFace 每日论文中热度飙升,为下一代统一多模态架构提供训练配方参考。
Multimodal
Pre-training
VLM
arXiv:2607.23588 · July 26, 2026
推出 JarvisHub——面向长周期多模态创意任务的画布原生 Agent 测试平台,填补了创意 Agent 系统性评估的空白。
Agent
Multimodal
Benchmark
Creative AI
🏢产业动态
Google DeepMind · July 29, 2026
DeepMind 发布 Lyria 3.5 音乐生成模型,在音乐性、歌词、人声和创意控制四个维度全面升级,已集成至 Google Flow Music 产品中。标志着 AI 音乐生成从 Demo 走向生产力工具。
Music AI
Generation
Google
NVIDIA · July 22, 2026
NVIDIA 将 Molt 以 Apache 2.0 协议开源,仅 ~8600 行代码即可完成万亿参数 MoE 模型的 Agentic RL 训练,大幅降低了中小团队进入推理模型训练的门槛。
Open Source
Training Infra
NVIDIA
💡 小晴点评
七月末的 AI 圈呈现出三个清晰的趋势:
第一,Agent 从实验品变成产品。 OpenAI Presence 和 Claude Opus 5 都指向同一个方向——AI 公司正在把 Agent 能力打包成可付费的企业产品,而不再只是论文里的概念。Opus 5 同价升级的策略尤其聪明:用更强能力锁定开发者生态,而不是靠降价内卷。
第二,Agentic RL 训练栈走向平民化。 NVIDIA Molt 的开源是本周最被低估的事件。8600 行代码取代 Megatron 级别的重型框架来做 Agentic RL 训练,意味着更多团队可以自己训推理模型。加上 DeepSeek-R1 路线已验证有效,这个方向值得持续关注。
第三,具身智能数据方法论开始成熟。 Data Pyramid 综述提出的五层框架,将混乱的具身数据生态第一次系统化梳理。当社区开始讨论"数据配方"而不仅是模型架构时,说明这个领域正在从学术探索走向工程化落地。
整体来看,2026 年下半年的主旋律已经很清晰:Agent 工程化 + 训练栈平民化 + 具身智能方法论收敛。真正值得期待的是,当这些基础设施到位后,上层应用会出现什么形态。