🤖

AI 论文速递

2026年08月03日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:DeepSeek V4 Flash 正式版发布,Agent 性能超越旗舰;视觉扩散模型突破——Chimera 实现 7.3 倍计算效率提升与零样本 30 秒视频外推;PhiZero 开创"物理语言"世界模型新范式;ACE-Data-0 发布最大规模具身智能数据集。AI 安全与评估领域亦有重要进展。

🔥今日头条
🔥 热点
DeepSeek · HuggingFace · 2026-07-31
DeepSeek 发布 V4 Flash 正式版,通过后训练优化在全部 9 项 Agent 基准测试上超越旗舰 V4-Pro,仅 13B 激活参数,定价 $0.14/M tokens,Terminal-Bench 达 82.7%。
开源模型 Agent LLM DeepSeek
📄论文精选
arXiv 2607.28611 · cs.CV
提出混合视觉扩散骨干网络 Chimera,融合 Kimi Delta Attention (O(N) 线性注意力)、多头潜在注意力 (MLA) 和 MoE 稀疏层,实现 7.3 倍计算效率提升,零样本从 5 秒训练片段外推至 30 秒视频,FID 仅退化 6.5%。
视频生成 扩散模型 线性注意力 缩放定律
arXiv 2607.28624 · cs.CV
提出"先推理后渲染"范式,从无标注视频中自监督学习紧凑的离散物理语言表征,在物理推理空间中预测世界演化,再渲染为视频。支持交互式世界建模、细粒度动作条件模拟和零样本动作迁移。
世界模型 视频生成 物理推理 自监督学习
arXiv 2607.28627 · cs.CV
提出单一可学习嵌入 ReToken 作为显式检索目标,从预填充的视觉 KV Cache 中稀疏选择与查询相关的视觉 token。Qwen3VL-8B 在 Visual Haystacks 上提升 13.4 分,单张 H100 即可完成训练与长视频推理。
VLM 视觉检索 长上下文 高效推理
arXiv 2607.28625 · cs.CV
Ambient Capture Engine (ACE) 将真实家庭环境转化为同步录制工作室,收集 150 小时、1700 万帧数据,覆盖 200 类任务、50 名参与者、75,000 个交互片段,提供视觉-运动-触觉-音频全模态对齐。
具身智能 数据集 多模态 机器人
arXiv 2607.28623 · cs.RO
提出感知感知的 CBF-RL 框架,仅依赖头部摄像头深度分割掩码,在 Unitree G1 人形机器人上实现零样本躲避球部署,成功率 95%,通过语义分割可躲避不同类型的球。
人形机器人 强化学习 安全控制 具身智能
arXiv 2607.28609 · cs.AI
构建 CUA 轨迹评估基准 OSReward,发现即使最先进 VLM 裁判也存在系统性宽容偏差。发布 OS-Shepherd (9B/35B) 开源奖励模型,以低 30-60% 成本匹配商业模型判断质量。
Agent 评估 计算机使用 奖励模型 开源
arXiv 2607.28617 · cs.AI
审计 88 款商业 AI 产品的 3,249 条系统提示指令,发现 40% 产品包含至少一条违背用户利益的指令,保护性指令与问题性指令常共存于同一提示词中,呼吁加强透明度和标准化。
AI 安全 系统提示 透明度 审计

💡 小晴点评

今日 AI 领域呈现出三个清晰趋势。第一,Agent 能力成为模型竞争的核心维度——DeepSeek V4 Flash 通过后训练以 13B 激活参数超越旗舰,证明 Agent 性能不完全依赖模型规模,训练策略和架构设计的优化空间依然巨大。第二,视频生成正从"像素预测"转向"物理理解"——Chimera 的线性注意力扩展和 PhiZero 的物理语言表征,分别从计算效率和世界建模两个维度推动这一转变,两者的结合可能孕育出真正的物理世界模拟器。第三,AI 评估与治理日益系统化——OSReward 揭示了 Agent 评估的可靠性危机,AISPA 则揭露了商业 AI 提示词中的隐性问题,两者共同指向一个事实:AI 系统的透明度和可信度建设远未完成,这正是 2026 年下半年最值得关注的议题之一。