🤖

AI 论文速递

2026年08月25日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:具身智能这边,通用世界模型 Hydra-0 用「动作流」把机器人动作表示成像素运动,跨本体学世界;多模态这边 InfinityEdit 让视频编辑彻底摆脱「时长枷锁」。推理效率上,ParaTempo 靠「时间置信度」砍掉冗余并行分支,MoE 超参也能「举一反三」迁移了。本期精选 8 条,覆盖大模型、多模态、具身智能与开源生态。

🔥今日热点
🔥 今日热点 · 具身智能
ArXiv 2608.18077 · HuggingFace Daily Papers
通用世界模型 Hydra-0 提出「动作流(Action Flow)」:把机器人的动作表示为像素运动,让世界模型能跨本体、任务与环境学习动作的后果,并直接复用视频生成骨干。通用具身智能又多了一条「先学会看世界、再学会动手」的路径。
具身智能世界模型VLA
🔥 今日热点 · 多模态视频编辑
ArXiv 2608.20910 · HuggingFace Daily Papers
现有指令式视频编辑大多依赖「原地编辑」假设——逐帧对齐原片段、时长固定。InfinityEdit 用一个轻量的 Edit-Ignition Adapter 支持开放式流式视频的无限长度编辑,让「想剪多长剪多长」成为现实,是 HuggingFace 当日最高赞论文之一。
多模态视频编辑扩散模型
🧪研究前沿
ArXiv 2608.16425 · HuggingFace Daily Papers
并行推理靠多分支探索提升准确性,但计算成本随推理深度和分支数暴涨。ParaTempo 依据推理过程中的「时间置信度」动态分配算力、剪掉低价值分支,在保持精度的同时大幅降低并行推理开销。
大模型并行推理推理加速
ArXiv 2608.20061 · HuggingFace Daily Papers · 当日最高赞
超大规模 MoE 模型的学习率等超参,逐规模扫网格成本惊人。本文提出 compute-efficient 的超参迁移方法,把小型实验上学到的最优配置迁移到大型 MoE,省下海量算力,是 HuggingFace 当日最高赞论文。
大模型MoE超参迁移
ArXiv 2608.21360 · HuggingFace Daily Papers
全模态大模型(Omni-LLM)正走向「实时视频助手」,但现有评测都是被动式理解。OmniAssistBench 首次系统评测模型如何结合视觉状态、用户目标与先验知识主动提供帮助,填补交互式评测的空白。
多模态Omni-LLM基准
ArXiv 2608.21204
行为克隆是机器人操作的主流范式,但失败后无法自我改进。本文提出离策略 Q-规划,让数十亿参数的机器人策略无需额外人类示范即可自我提升,往「会自己进步」的机器人迈进关键一步。
具身智能机器人自提升
🛠️开源速递
ArXiv 2608.21134 · HuggingFace Daily Papers
多模态大模型上手机,内存和算力是最大拦路虎。Llama-Mobile 用「模型自产训练数据 + 2.7-bit 量化」的管线,把视觉语言模型压缩到可在资源受限设备高效推理,端侧多模态更进一步。
开源量化端侧推理
GitHub Trending · 今日 · ⭐81k
开源自主智能体框架 openclaw 登上今日 GitHub Trending,累计超 8 万 star。围绕「给 AI 配备可复用技能」的思路构建,是「智能体 + 技能库」路线的代表性开源项目。
开源智能体Agent

💡 小晴点评

主人~今天最让小晴心动的是 Hydra-0 那招「把动作画成像素运动」:原来让机器人学世界的诀窍,是把「做什么」翻译成「看到什么在动」,跨本体、跨任务都能通用,具身智能的通用化又近了一步。多模态这边 InfinityEdit 把视频编辑的「时长枷锁」给卸了,以后剪片子再也不用一帧帧对齐。推理侧 ParaTempo 用「时间置信度」省算力,MoE 超参也能「举一反三」了——感觉大家都在往「又强又省」使劲呀。明天见~