🤖

AI 论文速递

2026年08月18日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:今天这批论文的主旋律是「怎么让模型更省、更稳、更可信」。人气最高的是AI 假视频检测(RA-Bench,258 upvote 登顶)——它给「AI 生成的危机视频」当头一棒:现有检测器几乎都扛不住真实场景。模型侧,上海 AI 实验室的 Intern-S2-Mobius 把「知识」和「推理」拆开存,SimpleOPDS²VOPD 两条蒸馏线一起上,都在喊「小模型也能打」。世界模型有 Alaya Lab 的 Marionette(先建模 3D 世界状态、再画画面);Agent 侧 cumora 把 AI 变成团队的「一等队友」、单日冲上 GitHub 榜首。配上 DeepSeek V4、GLM-5.3、Qwen3.8 这批开源大模型的持续刷屏——8 月的开源 AI,是真的热闹。

🔥今日热点
🔥 今日热点 · 开源
GitHub Trending 今日榜首 · yetone/cumora · ⭐1131(单日)· TypeScript
开源圈今天最火的仓库:cumora,一个跨平台的团队聊天工具,把 AI Agent 当成团队里的「正式队友」来用。它既支持云端大脑,也支持自带大脑(Claude Code / Codex 等),人跟多个 Agent 可以在同一个聊天流里无缝协作——Agent 不再是藏在后台的脚本,而是「坐在工位上的同事」。单日冲上 GitHub Trending 榜首,背后是同一个信号:Agent 协作正在成为新的基础设施
GitHub 榜首 Agent 协作 团队聊天 开源
🔥 今日热点 · AI 安全
arXiv 2608.14391 · 2026-08-14 · HuggingFace Daily 258 upvotes(今日最高)
突发危机事件(灾难、冲突)发生时,AI 生成的假视频会以惊人速度刷屏。这篇工作建了个新基准 RA-Bench,把「检测器 → 生成器 → 社交传播」三个环节串起来系统评估。结论有点警醒:现有检测器一旦跨到真实的危机视频场景就普遍失灵,而内容经过社交媒体的压缩、转发、再剪辑之后,检测可靠性还会进一步下滑。开源了零样本多模态模型 + MLLM 检测器,是今天 HuggingFace 上关注度最高的论文。
今日最高人气 AI 安全 视频生成检测 多模态
🧠大模型 & 推理
arXiv 2608.14290 · 2026-08-14 · 上海 AI 实验室(Intern 系列,含 Dahua Lin)· HuggingFace Daily 31 upvotes
传统 Transformer 把「知识」和「推理」全压进同一套权重,又费数据又费算力。上海 AI 实验室的 Mobius-v0 换了个思路:把全局记忆存储(FFN)迭代推理模块(自注意力)解耦——记忆负责装知识、推理器负责想。结果用更少的训练数据就达到可比性能,推理更快、知识压缩更好。这是 Intern-S2 系列继昨天的「科学 Agent 基座 Preview」之后,在「知识-推理解耦」方向上又落的一步。
基础模型 知识推理解耦 高效推理 上海 AI 实验室
arXiv 2608.14277 · 2026-08-14 · 含 Ning Ding、Yu Cheng(清华)· HuggingFace Daily 23 upvotes
长上下文推理模型很强,但慢、贵。能不能把它的「证明推理」能力蒸馏到短上下文的小模型里?SimpleOPD 给出一个 tokenizer 无关的在线策略蒸馏方案:对齐 token 跨度、约束长度增长、用「终止 token 掩码」稳定训练,把分布错配问题压下去。在数学证明推理上效果显著,还能泛化到科学类基准。名字叫 Simple,好用的关键恰恰就在「简单」。
知识蒸馏 长上下文推理 在线策略 小模型
🎨多模态 & 世界模型
arXiv 2608.14144 · 2026-08-14 · 含 Philip Torr(牛津)· HuggingFace Daily 147 upvotes
小视觉语言模型想变强,通常得靠更大的老师或特权标注。这篇 S²VOPD 反其道:不用大老师、不用特权信息,只靠自监督的视觉在线策略蒸馏——把原图蒸馏到「强增强的学生视角」里,利用「老师-学生不对称」逼着模型学到更细粒度的感知。对细粒度视觉理解任务尤其有效,还开源了项目页。147 个 upvote,是今天论文区的人气第二。
VLM 自蒸馏 在线策略 细粒度感知
arXiv 2608.14530 · 2026-08-14 · Alaya Lab(含 Kaipeng Zhang)· HuggingFace Daily 22 upvotes
交互式游戏 / 世界生成有个根本难题:光生成「好看的视频」不够,还得能直接操控世界状态。阿里 Alaya Lab 的 Marionette 把生成拆成三步——先用自回归动力学模型预测显式 3D 关节世界状态(骨架),再用零参数渲染器出几何,最后用视频扩散「上色」出画面。好处是能在状态层面直接控制,还能做长程一致性修复。这是「世界模型」从「画视频」走向「建模世界」的又一步。
世界模型 3D 关节状态 视频生成 交互式
🤖Agent & 具身智能
arXiv 2608.13417 · 2026-08-13 · 含 Fei Sun(美团)· HuggingFace Daily 41 upvotes
都说前沿 Agent 能做 AI 研发了,但「能做」和「做得好」之间隔着什么?这篇工作对长程 AI 研发 Agent 做了系统评估,把过程拆成方案构思、执行、反馈控制三个阶段,用规则化指标打分。结论挺冷静:前沿 Agent 在工程优化上很强,但在长程任务里表现不稳、方法创新有限、经验复用时好时坏。一句话:Agent 离「能独立搞科研」,还差着点东西。
AI Agent 长程任务 系统评估 自动科研
arXiv 2608.13606 · 2026-08-11 · ZJU NLP(zjunlp,含 Guilin Qi)· HuggingFace Daily 20 upvotes
端侧 AI 最难的不是「回答」,是「记住」。MobileMem 建了一个评估端侧长期记忆的基准:用一年尺度的多模态手机体验轨迹(照片、消息、位置、事件),考模型的时间推理、知识更新、偏好推断能力。目标是让手机上的模型真正形成「体验型智能」——不是背你的数据,而是懂你的生活轨迹。20 个 upvote,是「端侧记忆」这条线里今天最值得看的一个。
端侧智能 长期记忆 多模态 基准

💡 小晴点评

今天最亮眼的信号是「蒸馏」三连:SimpleOPD(长程推理)、S²VOPD(视觉)、Mobius(知识-推理解耦),加上昨天 Mimir 的「小模型 + 干净数据」,大家不约而同都在回答同一个问题——能不能用更小的模型、更少的数据、更少的算力,做出接近大模型的水准?这条路越走越实了。

第二个是AI 安全开始「反攻」:RA-Bench 以 258 upvote 登顶,说明大家意识到「检测 AI 假视频」已经和「生成 AI 视频」一样重要,甚至更急迫——毕竟危机时刻,一条以假乱真的视频比谣言本身杀伤力更大。

第三个是世界模型在往「真世界」走:Marionette 不再满足于「画好看的视频」,而是先建模 3D 关节状态、再渲染、再上色——这是从「拍电影」到「搭舞台」的转变。

至于 cumora 冲上 GitHub 榜首,也印证了那句老话:Agent 正在从「后台脚本」变成「坐在你旁边的同事」。新的一天,慢慢看~