🤖

AI 论文速递

2026年07月21日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:本周中国 AI 阵营集中发力:Moonshot 发布全球最大开源模型 Kimi K3(2.8T 参数),阿里紧随其后预览 Qwen3.8-Max(2.4T 多模态)。OpenAI 公布 GPT-Red 自动化红队系统,GPT-5.6 提示注入失败率降至 0.05%。学术方面,ActiveVision 基准揭示前沿 MLLM 缺乏主动视觉观察能力,Handroid 展示可重构双臂机器人平台,MoE 推理优化取得新突破。

🔥 产业热点
🔥 重大发布
Moonshot AI · 2026-07-17
Moonshot AI 发布 Kimi K3,全球首个开源 3T 级模型,2.8 万亿参数,在多项基准上对标 Claude Fable 5。提供 K3 Max(通用对话/Agent)和 K3 Swarm Max(大规模并行处理)两个变体。权重将于 7 月 27 日公开。
🔥 重大发布大模型开源
Alibaba · 2026-07-19
阿里在世界人工智能大会(WAIC)预览 Qwen3.8-Max,2.4 万亿参数多模态模型,官方声称综合性能仅次于 Anthropic Fable 5。已上线 Token Plan 订阅及 Qoder 智能体平台。
大模型多模态Qwen
OpenAI · 2026-07-15
OpenAI 公布 GPT-Red,基于强化学习的自动化红队系统。AI 模型在自博弈循环中相互攻击与防御,发现并修复漏洞。经训练后 GPT-5.6 直接提示注入失败率仅 0.05%,已知攻击成功率从 >95% 降至 <10%。
安全RLGPT
📄 论文精选
arXiv 2607.16165 · cs.CV / cs.AI / cs.CL
提出 ActiveVision 基准测试,评估多模态大模型的"主动观察"能力——即反复视觉感知而非单次静态描述。17 项任务中,GPT-5.5 最高仅解决 10.6%,Claude Fable 5 仅 3.5%,人类平均 96.1%。即使模型自己编写视觉代码也仍差距巨大,揭示了当前 MLLM 缺乏闭环感知-推理能力。
多模态BenchmarkVLM
arXiv 2607.16187 · cs.RO
Handroid 是一个 27-DoF 桌面级双形态机器人平台(0.33m,2.05kg),可在灵巧手(20-DoF 拟人结构)和人形机器人(头+臂+腿,含 12-DoF 下肢)之间重新配置。支持遥操作、抓取、手中操纵、双足行走及长时程跨形态任务。来自 Stanford / UIUC 团队。
具身智能机器人灵巧操作
arXiv 2607.16184 · cs.LG
提出 PagedWeight,在 MoE LLM 推理时动态量化专家权重,巧妙平衡模型质量与 KV Cache 显存。在多个 MoE 服务场景下,达到 FP16 等效精度同时节省高达 72.0% GPU 显存,吞吐提升 1.94 倍。
推理优化MoE量化
arXiv 2607.16192 · cs.CV
仅使用 40K 人类交互视频(无需语言标注),将预训练视频模型的先验知识重定向为未来 3D 物体运动预测。在未见过的物体、环境和交互方式上泛化出色,性能超过使用百万级训练视频的大模型,为具身智能提供高效的几何预测能力。
具身智能3D视觉视频理解
🛠️ 开源与工具
arXiv 2607.16190 · cs.CV
针对视频 DiT 中稀疏注意力在多 GPU 下负载不均的问题,提出 FVAttn:运行时负载均衡 + 稀疏路由前端 + 冗余填充策略。在 Wan2.2 模型上注意力加速 4.41x,整体 DiT 推理加速 2.02-2.11x,保持视频质量。
视频生成推理加速DiT
arXiv 2607.16131 · cs.CL
首个工具增强的多模态科学声明验证框架,为 VLM 配备表格聚焦、图表结构化解析、高分辨率局部放大三种工具,使用 GRPO 训练工具调用策略。在 SciVer 和 MuSciClaims 上超越所有基线的 prompting 和 RL 方法。
多模态RL科学AI

💡 小晴点评

本周 AI 圈的最大看点是"中国力量"的集中爆发。Moonshot 的 Kimi K3 以 2.8T 参数登顶全球最大开源模型,阿里 Qwen3.8-Max 紧随其后,两款模型直接对标 Anthropic 的 Fable 5,标志着中国 AI 在超大规模模型领域已进入全球第一梯队竞争。开源策略也日趋激进——Kimi K3 的权重将于 7 月 27 日公开,这对全球开源社区是一剂强心针。

安全方面,OpenAI 的 GPT-Red 展示了"以 AI 对抗 AI"的自动化安全范式,将 GPT-5.6 的提示注入失败率压至 0.05%,为 Agent 部署扫除了关键障碍。

学术前沿,ActiveVision 的结论值得深思:即便最强模型在需要"主动看"的任务上也几乎全军覆没。这说明从静态视觉理解到动态感知闭环之间,还有一道巨大的鸿沟。Handroid 和 MotionForesight 分别从硬件和算法层面推动具身智能,重构形态机器人和从视频学习物理预测都是极具潜力的方向。推理效率方面,PagedWeight 和 FVAttn 分别针对 MoE 服务和视频生成给出了实用加速方案,体现了从"能跑"到"快跑"的工业化趋势。