📄 论文精选
arXiv 2607.16165 · cs.CV / cs.AI / cs.CL
提出 ActiveVision 基准测试,评估多模态大模型的"主动观察"能力——即反复视觉感知而非单次静态描述。17 项任务中,GPT-5.5 最高仅解决 10.6%,Claude Fable 5 仅 3.5%,人类平均 96.1%。即使模型自己编写视觉代码也仍差距巨大,揭示了当前 MLLM 缺乏闭环感知-推理能力。
多模态BenchmarkVLM
arXiv 2607.16187 · cs.RO
Handroid 是一个 27-DoF 桌面级双形态机器人平台(0.33m,2.05kg),可在灵巧手(20-DoF 拟人结构)和人形机器人(头+臂+腿,含 12-DoF 下肢)之间重新配置。支持遥操作、抓取、手中操纵、双足行走及长时程跨形态任务。来自 Stanford / UIUC 团队。
具身智能机器人灵巧操作
arXiv 2607.16184 · cs.LG
提出 PagedWeight,在 MoE LLM 推理时动态量化专家权重,巧妙平衡模型质量与 KV Cache 显存。在多个 MoE 服务场景下,达到 FP16 等效精度同时节省高达 72.0% GPU 显存,吞吐提升 1.94 倍。
推理优化MoE量化
arXiv 2607.16192 · cs.CV
仅使用 40K 人类交互视频(无需语言标注),将预训练视频模型的先验知识重定向为未来 3D 物体运动预测。在未见过的物体、环境和交互方式上泛化出色,性能超过使用百万级训练视频的大模型,为具身智能提供高效的几何预测能力。
具身智能3D视觉视频理解
💡 小晴点评
本周 AI 圈的最大看点是"中国力量"的集中爆发。Moonshot 的 Kimi K3 以 2.8T 参数登顶全球最大开源模型,阿里 Qwen3.8-Max 紧随其后,两款模型直接对标 Anthropic 的 Fable 5,标志着中国 AI 在超大规模模型领域已进入全球第一梯队竞争。开源策略也日趋激进——Kimi K3 的权重将于 7 月 27 日公开,这对全球开源社区是一剂强心针。
安全方面,OpenAI 的 GPT-Red 展示了"以 AI 对抗 AI"的自动化安全范式,将 GPT-5.6 的提示注入失败率压至 0.05%,为 Agent 部署扫除了关键障碍。
学术前沿,ActiveVision 的结论值得深思:即便最强模型在需要"主动看"的任务上也几乎全军覆没。这说明从静态视觉理解到动态感知闭环之间,还有一道巨大的鸿沟。Handroid 和 MotionForesight 分别从硬件和算法层面推动具身智能,重构形态机器人和从视频学习物理预测都是极具潜力的方向。推理效率方面,PagedWeight 和 FVAttn 分别针对 MoE 服务和视频生成给出了实用加速方案,体现了从"能跑"到"快跑"的工业化趋势。