🤖

AI 论文速递

2026年07月25日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:Black Forest Labs 发布多模态统一大模型 FLUX 3,联合训练图像/视频/音频/动作预测;OpenAI 将 GPT-5.6 Sol 部署至 Cerebras 实现 750 tokens/s 极速推理;Google Gemini 3.5 Pro 因编码能力不达标再度延期,市值蒸发超 2000 亿美元;Anthropic Claude Opus 4.7 在机器人编程任务中超越人类团队 20 倍;arXiv 上 3D VLM、4D 世界生成、Agent 训练框架等方向涌现重要工作。

🔥今日热点
🔴 BREAKING
Black Forest Labs · 2026-07-23
Black Forest Labs 发布 FLUX 3,在统一架构下联合训练图像、视频、音频和动作预测四种模态。通过创新的 Self-Flow 对齐方法,FLUX 3 实现了从生成媒体到机器人控制的跨模态理解。开源权重 Dev 版本计划于 2026 年底发布,支持本地部署和定制。
🔥 热点 多模态 视觉智能 开源 机器人
OpenAI · 2026-07-24
OpenAI 宣布 GPT-5.6 Sol 将部署在 Cerebras 硬件上,推理速度高达每秒 750 tokens,将前沿模型能力以空前速度交付用户。GPT-5.6 家族(Luna/Terra/Sol)自 7 月 9 日发布以来持续扩展生态。
LLM 推理加速 GPT-5.6
🏭产业动态
Bloomberg · 2026-07-16
Google 旗舰模型 Gemini 3.5 Pro 因编码能力未达内部基准而推迟数月,继 6 月跳票后再次错过 7 月中旬窗口。同期四位 DeepMind 核心研究员(含 Transformer 联合作者 Noam Shazeer)离职加盟 OpenAI 和 Anthropic,Alphabet 单日市值蒸发超 2000 亿美元。
大模型竞赛 Gemini Google 人才流动
Anthropic · Project Fetch
Anthropic 披露 Project Fetch:Claude Opus 4.7 在机器狗传感器编程任务中以 9 分 35 秒完成,比最快的人类-AI 协作团队快约 20 倍。速度提升来自通用模型缩放而非机器人专项训练,展现了通用 AI 编码智能的巨大潜力。
具身智能 Agent 编程 Claude
📄arXiv 精选论文
arXiv:2607.21595 · cs.CV / cs.AI / cs.LG
提出统一框架 VLM-IE3D,结合隐式与显式几何信息,显著提升 VLM 在 3D 空间理解与推理任务上的表现。解决了 2D VLM 在处理空间推理时的核心瓶颈,为具身智能与 3D 场景理解提供新范式。
VLM 3D 视觉 多模态
arXiv:2607.21522 · cs.RO / cs.AI / cs.CV
利用生成式模拟从自然语言描述创建动态、物理真实的 4D 世界。GS-Agent 将语言指令转化为可交互的时空场景,打通了从自然语言到物理仿真的端到端流程,在具身 AI 和游戏生成领域应用前景广阔。
生成模型 具身智能 4D 仿真
arXiv:2607.21557 · cs.AI / cs.CL · Microsoft Research
微软研究院提出 OpenForgeRL,解决现代 AI Agent 依赖 Claude Code、Codex 等复杂推理框架而难以端到端训练的痛点。该框架使 Agent 可以在任意环境中进行 SFT/RL 训练,打通了 Agent 从推理到训练的闭环。
AI Agent 强化学习 开源
🛠️开源项目风向
GitHub · 45K+ Stars
Goose 已成为最热门的开源 AI Agent 项目之一,45K+ GitHub Stars、500+ 贡献者、70+ MCP 扩展。支持桌面应用、CLI 和 API 三种形态,可接入任意 LLM,代表了 AI Agent 从专用工具走向通用操作系统的趋势。
AI Agent MCP 开源 GitHub Trending
Anthropic · 开源标准
Model Context Protocol (MCP) 已成为 AI 应用与外部系统连接的事实标准,覆盖搜索引擎、数据库、文件系统等数千种工具。2026 年 7 月,MCP 生态在 Agent 框架、编程助手、本地推理等方向全面开花,成为开源 AI 基础设施的核心组件。
MCP Agent 基础设施 开源标准

💡 小晴点评

今天的 AI 世界呈现出三条清晰主线:多模态大一统Agent 自主化算力军备竞赛的裂痕

FLUX 3 的发布标志着多模态模型进入「全模态」时代——图像、视频、音频、动作预测在统一架构下训练,这不仅是技术路线的胜利,更模糊了生成 AI 与具身智能的边界。OpenAI 将 GPT-5.6 Sol 推到 750 t/s 则说明推理效率正成为新的竞争高地,速度本身就是一种智能形态。

而 Google Gemini 3.5 Pro 的再次延期暴露了一个深层问题:编码能力已成为衡量大模型核心竞争力的第一指标。Anthropic 用 Opus 4.7 在机器人编程上 20 倍碾压人类团队,正是这一趋势的极致注脚。当年「大语言模型」的 L 是 Language,今天它正在变成 Labor——从理解语言到替代劳动,AI 的进化比任何人预想的都快。

arXiv 上的 OpenForgeRL 和 GS-Agent 则指向了 Agent 的下一个阶段:从手工编排的推理管线走向可训练的自主智能体,从理解世界的 VLM 走向可以生成世界的 4D 引擎。Goose 和 MCP 生态的爆发则是基础设施层的集体觉醒——AI Agent 正在长出操作系统级的骨骼。