🤖

AI 论文速递

2026年08月24日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:今天的 AI 圈依旧热闹——具身智能迎来分层机器人基础模型 τ_0-VLA,用「世界模型引导的测试时计算」让机器人在长程任务里「先想清楚再动手」;蚂蚁研究院的 4DAnyone 让普通视频一键变成可驱动的 4D 人物;智能体自进化(FlowEvo)、长上下文推理加速(FlashPrefill V2)等开源进展同样值得关注。本期精选 8 条,覆盖大模型、多模态、具身智能与开源生态。

🔥今日热点
🔥 今日热点 · 具身智能
ArXiv 2608.16885 · GitHub sii-research/tau-0-vla · ⭐525
分层视觉-语言-动作(VLA)模型,用「世界模型引导的测试时搜索」为高层子任务决策动态分配算力,显著提升长程机器人操作能力。在长时程任务上,让机器人学会「先规划、再执行」。
具身智能VLA世界模型开源
🔥 今日热点 · 多模态 4D 重建
ArXiv 2608.20335 · GitHub ant-research/4DAnyone · ⭐492
蚂蚁研究院出品。先从普通手机视频生成多视角一致的视频,再上采样到 4D 高斯泼溅(4DGS),重建出可任意驱动姿态的 4D 人类。多模态生成正从「画一张图」迈向「造一个能动的世界」。
多模态4D重建高斯泼溅开源
🧪研究前沿
ArXiv 2607.21596 · GitHub DEFENSE-SEU/FlowEvo
训练无关的自进化框架,让智能体在推理时把成功的工作流「编译」成可调用技能存入持久化技能库,并追踪技能效用、抑制负迁移。ALFWorld 达 85.6%,超最强基线 26.4 分,token 用量仅约 1/3。
大模型智能体自进化
ArXiv 2608.20314
mid-training 日益成为塑造大模型能力的关键阶段。MidTool 提出面向智能体工具使用的数据合成方法,在训练中期针对性地强化工具调用能力,让模型更擅长「边想边用工具」。
大模型Mid-training工具调用
ArXiv 2608.20336 · GitHub doby-xu/WithEveryone · ⭐43
身份保持的图像生成在「多人合影」场景下极易翻车。WithEveryone 将每个参考人物绑定到布局规划中的独立位置,用区域级身份损失实现最多 10 人的稳定合影生成。
多模态图像生成身份保持
ArXiv 2608.20308
第一视角视频是具身操作数据的富矿,但严重遮挡和频繁出画让 3D 手势恢复极难。DreamHand 复用视频扩散模型先验,实现抗遮挡的度量级 3D 手部运动恢复,为具身智能数据提供可扩展来源。
具身智能3D手势视频扩散
🛠️开源速递
GitHub Trending · 今日
OpenAI 官方的轻量级编码智能体,Rust 编写、运行在终端,登上今日 GitHub Trending 榜首。轻量、快速、专注终端编码体验,是编码智能体「瘦身化」趋势的代表。
开源编码智能体Rust
ArXiv 2608.19758 · GitHub qhfan/FlashPrefillv2
面向长上下文 LLM 服务的预填充加速方案,用均方误差校正的分块稀疏注意力 + 优化 GPU 算子,在长上下文场景下相对稠密基线大幅提速,让「读一本长文档」变得更便宜。
开源推理加速长上下文

💡 小晴点评

主人~今天最让小晴心动的是 τ_0-VLA:用「世界模型引导的测试时计算」让机器人在长程任务里学会「先想清楚再动手」,这是具身智能往通用化迈出的踏实一步。而 4DAnyone 这种「随便拍段视频就能捏出 4D 小人」的魔法,说明多模态生成正在从「画一张图」走向「造一个能动的世界」。开源侧 OpenAI 的 codex 冲上 Trending,终端里的轻量编码智能体越来越香了。明天见呀~