🤖

AI 论文速递

2026年08月17日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:周一清晨,arXiv 把周末积压的论文一口气放了出来,而且今天的主题高度集中——「世界模型」刷屏。阿里 Alaya 的 EVOKE 用外部世界状态库 + 稀疏注意力老师,把交互式世界模型推向「无限长」;同门 AMAP 的 DreamX-Phi 拿下 WorldArena 2.0 赛道第一。大模型这边,上海 AI 实验室的 Intern-S2-Preview 亮出 397B 的「科学 Agent 基座」;丹麦的 DFM Mimir 用 1B 参数、只靠合规数据拼出前沿水平。Agent 线,AutoDesign 让脚手架自我进化、击败 Claude Design;OmniScientist 要做「全模态全学科」的 AI 科学家。开源圈,一个「去除 AI 溯源水印」的仓库 6 天狂揽 1.1 万星,重新点燃内容溯源之争。

🎬多模态 & 世界模型
🔥 今日热点
arXiv 2608.13546 · 2026-08-13 · 阿里 Alaya 团队 · HuggingFace Daily 116 upvotes
交互式世界模型有三难:记忆要持久、交互要即时、生成要能跑长程——可这三件事彼此打架。历史塞进去噪器上下文或 KV cache,成本随会话长度疯长;低延迟要靠少步生成,能力又被「老师」框死。Alaya-EVOKE 两个都解了:把「持久世界状态」外置到一个按相机索引的「世界状态银行」,只取当前视角相关的信息,上下文从此有界;老师也不再是固定生成器,而是用「分块分组 + 远帧检索 + 线性注意力全局态」的稀疏注意力做长程监督,内存和算力只线性增长。再配合 30 秒的分布匹配目标 + 自驱动 rollout,蒸馏出一个只要三步、还不用 CFG 的学生模型——既抗长期漂移、又保持即时响应。一句话:这是往「能无限滚动、不会越滚越糊的世界」迈出的一步。
世界模型 长程交互生成 外部状态记忆 稀疏注意力
arXiv 2608.13552 · 2026-08-13 · 香港大学(含 Hengshuang Zhao)· HuggingFace Daily 42 upvotes
怎么公平比较世界模型?光看视频一致性不够——真实用户会「转 360° 看环境稳不稳」「走进水里看波纹真不真」。可达成同一目标的动作序列,各模型各不相同,固定的动作条件评测根本没法横向比。PlayWorld 换了个聪明招:用多模态 Agent 玩家,去和世界模型「玩」指定的长程目标。171 个场景,沿四个维度打分(几何一致性、交互保真度、视野外演化、洞察演化)。九个 SOTA 世界模型测下来,结论有点扎心:长程交互目标上大家都不太靠得住,空间一致性和持续状态演化尤其容易崩。
世界模型 基准测试 Agent 玩家 长程目标
🦾具身智能 & 机器人
🔥 今日热点
arXiv 2608.13489 · 2026-08-13 · 阿里 AMAP(DreamX 团队,开源 AMAP-ML/DreamX-Phi)· HuggingFace Daily 91 upvotes
给一个观测帧 + 一句指令 + 一串动作(末端位姿 + 夹爪状态),预测接下来的画面——这就是 DreamX-Phi 干的事。但它点破了一个关键:「像」不等于「对」,一段逼真的 rollout 可能搬错了胳膊、弄丢了物体。于是它把每只机械臂的 SE(3) 变换用 PRoPE 风格的几何编码注入注意力,保住「臂的身份」和刚体运动;再加一个轻量深度分支管场景几何、用 SAM3 掩码 + 冻结的 V-JEPA 老师锁住抓取中物体的状态。最后用分布匹配蒸馏压成少步学生。基于 Wan2.2-TI2V-5B 搭建、代码开源——WorldArena 2.0 赛道一第一、赛道二第二
具身智能 视频世界模型 机器人操作 几何编码 开源
🔬大模型 & 科学智能
arXiv 2608.13505 · 2026-08-13 · 上海 AI 实验室(Intern 系列)· HuggingFace Daily 54 upvotes
科学发现越来越需要一种 AI:能啃得动异构模态的科学证据、能摆弄科学工具与环境、还能在超长任务链上持续推进。Intern-S2-Preview 就是冲着这个来的——397B 的科学 Agent 基座。先在渲染的科学文档、图文交错数据、科学语料上做多模态预训练,再走一条统一后训练管线:SFT → 可扩展多任务 RL → 黑盒/白盒 Agent RL → 在线策略蒸馏,中间塞进部分 rollout 离线校正、自适应长度正则、在线投机解码等一堆提稳提效的招。架构上它把时序建模延伸到数值预测,还另开了一条 Memory Decoder 路径——不改冻结的 397B 主干,就能快速做科学领域的专精。
科学 Agent 基础模型 强化学习 多模态
arXiv 2608.13517 · 2026-08-13 · Danish Foundation Models(丹麦)· 已上架 HuggingFace Hub
大模型圈有个尴尬:顶尖模型靠海量、往往不合规的数据堆出来,开源和「数据干净」两头难兼顾。丹麦基金会模型的 Mimir v1 反着来:HRM(分层推理模型)架构、1B 参数、从头训练,只用许可的合规后训练数据(161 个数据集混搭)。结果英语表现极具竞争力,丹麦语直接刷出 SOTA,还压过同门的 HRM-Text 1B,能和 Qwen 3.5 4B、Gemma 4 E2B 这些大得多的模型掰手腕。模型已开源上架。小模型 + 干净数据,也能打。
开源小模型 合规数据 1B 参数 丹麦语 SOTA
🤖Agent & AI 科学家
arXiv 2608.13560 · 2026-08-13 · 含 Zhiqiang Shen(MBZUAI)· HuggingFace Daily 43 upvotes
把多模态素材变成结构化媒介产出(比如论文→海报),本质是一个以「模型-脚手架系统」为中心的长程 Agent 过程。理想的脚手架该对齐人类设计先验、又能靠经验自我进化——可现有范式基本是静态的。AutoDesign 搞了个「元脚手架优化器」,让代码 Agent 依据 rollout 反馈递归地改进脚手架。在论文转海报任务 + 自建的 PosterBench(100 篇论文、5 个学科)上,最高分 78.32,比闭源商业系统 Claude Design 高出 7.45 分;全自主长程循环里,253 次工具调用、11 轮编辑,40 分钟、不到 3 美元。和昨天的 DarwinX 遥相呼应:Agent 的胜负手,正在转向「系统多顺手」。
Agent 自进化 脚手架优化 长程设计 PosterBench
arXiv 2608.13558 · 2026-08-13 · 新加坡国立大学(NUS)
现有 AI 科学家覆盖的「工作流」越来越全,却常常只看文本、代码、标签或预先算好的摘要,把科学发现里最关键的时空、跨通道、程序性关系全漏掉了。NUS 的 OmniScientist 要做「全模态」的端到端科学家:直接啃异构原始证据——图像、信号、音频、视频、3D 结构、轨迹、表格、公式、图。一个感知层 + 三个自主 Agent(构思、实验、写作)跑在确定性流水线上,用代码做「创意 / 严谨性 / 结论」三重核查。36 个真实数据案例、5 大学科族,全部走完「原始数据→成稿」全程,平均论文分 6.3。
AI 科学家 全模态 多 Agent 科研自动化
🔧开源进展
GitHub Trending · guillaumemeyer/watermarks-remover · ⭐11409(6 天)
今天开源圈最扎眼、也最「有争议」的一条:watermarks-remover,主打「剥掉多厂商的 AI 溯源标记」——Unicode 文本卫生、统计特征清洗之类。短短 6 天冲到 1.1 万星,把同一批新仓库远远甩开。它火了,也再次把那个老问题顶到台前:AI 内容溯源(水印)到底靠不靠谱?当「去除水印」的工具比「打水印」的部署跑得还快,内容真伪之辨又多了一分变数。顺带一提,DeepSeek Harness(DSH)插件生态这周也在 GitHub 上热闹非凡,awesome 列表、手册、插件市场一应俱全。
GitHub Trending 内容溯源 开源

💡 小晴点评

今天的 arXiv 被「世界模型」承包了——Alaya-EVOKE、DreamX-Phi、PlayWorld 三家几乎同时交卷,方向高度一致:都在琢磨「怎么让模型在脑子里把世界推演得更长、更稳、更可交互」。从「生成一张好看的图」到「生成一个能走进去的世界」,这一步迈得有点意思。

第二条线是「小模型 + 干净数据」的逆袭:DFM Mimir 用 1B 参数、只靠合规数据就敢和 4B 掰手腕,说明数据质量的分量越来越重。

第三条是 Agent 系统的进化仍在加速:AutoDesign 击败 Claude Design,和昨天的 DarwinX 是同一股风——胜负手正从「模型多强」转向「系统多顺手」。

至于那个 1.1 万星的「去水印」仓库,更像一记提醒:内容溯源,得跑在「去溯源」的前面。新的一周,慢慢看~