📄论文精选
arXiv 2607.28611 · cs.CV
提出混合视觉扩散骨干网络 Chimera,融合 Kimi Delta Attention (O(N) 线性注意力)、多头潜在注意力 (MLA) 和 MoE 稀疏层,实现 7.3 倍计算效率提升,零样本从 5 秒训练片段外推至 30 秒视频,FID 仅退化 6.5%。
视频生成
扩散模型
线性注意力
缩放定律
arXiv 2607.28624 · cs.CV
提出"先推理后渲染"范式,从无标注视频中自监督学习紧凑的离散物理语言表征,在物理推理空间中预测世界演化,再渲染为视频。支持交互式世界建模、细粒度动作条件模拟和零样本动作迁移。
世界模型
视频生成
物理推理
自监督学习
arXiv 2607.28627 · cs.CV
提出单一可学习嵌入 ReToken 作为显式检索目标,从预填充的视觉 KV Cache 中稀疏选择与查询相关的视觉 token。Qwen3VL-8B 在 Visual Haystacks 上提升 13.4 分,单张 H100 即可完成训练与长视频推理。
VLM
视觉检索
长上下文
高效推理
arXiv 2607.28625 · cs.CV
Ambient Capture Engine (ACE) 将真实家庭环境转化为同步录制工作室,收集 150 小时、1700 万帧数据,覆盖 200 类任务、50 名参与者、75,000 个交互片段,提供视觉-运动-触觉-音频全模态对齐。
具身智能
数据集
多模态
机器人
arXiv 2607.28623 · cs.RO
提出感知感知的 CBF-RL 框架,仅依赖头部摄像头深度分割掩码,在 Unitree G1 人形机器人上实现零样本躲避球部署,成功率 95%,通过语义分割可躲避不同类型的球。
人形机器人
强化学习
安全控制
具身智能
arXiv 2607.28609 · cs.AI
构建 CUA 轨迹评估基准 OSReward,发现即使最先进 VLM 裁判也存在系统性宽容偏差。发布 OS-Shepherd (9B/35B) 开源奖励模型,以低 30-60% 成本匹配商业模型判断质量。
Agent 评估
计算机使用
奖励模型
开源
arXiv 2607.28617 · cs.AI
审计 88 款商业 AI 产品的 3,249 条系统提示指令,发现 40% 产品包含至少一条违背用户利益的指令,保护性指令与问题性指令常共存于同一提示词中,呼吁加强透明度和标准化。
AI 安全
系统提示
透明度
审计
💡 小晴点评
今日 AI 领域呈现出三个清晰趋势。第一,Agent 能力成为模型竞争的核心维度——DeepSeek V4 Flash 通过后训练以 13B 激活参数超越旗舰,证明 Agent 性能不完全依赖模型规模,训练策略和架构设计的优化空间依然巨大。第二,视频生成正从"像素预测"转向"物理理解"——Chimera 的线性注意力扩展和 PhiZero 的物理语言表征,分别从计算效率和世界建模两个维度推动这一转变,两者的结合可能孕育出真正的物理世界模拟器。第三,AI 评估与治理日益系统化——OSReward 揭示了 Agent 评估的可靠性危机,AISPA 则揭露了商业 AI 提示词中的隐性问题,两者共同指向一个事实:AI 系统的透明度和可信度建设远未完成,这正是 2026 年下半年最值得关注的议题之一。