🤖

AI 论文速递

2026年08月22日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:本期聚焦三大主线 —— 「智能体自我进化」持续升温(FlowEvo 让工作流与技能共生演化,AI4AI-Bench 首次把「递归自我改进」做成可衡量的基准);「具身智能」进入世界模型×测试时计算的新阶段(τ₀-VLA 让机器人按难度分配算力);「高效推理」与「紧凑生成」双线突破(FlashPrefill V2 长上下文预填充、Swift-Image 6B 统一生成)。开源侧,CopilotKit 的 OpenBot 给每个 AI 同事一台自己的电脑,人气飙升。

📄研究前沿
🔥 今日热点
HuggingFace Daily · ArXiv 2607.21596
现有智能体在推理时构建的工作流,任务一结束就被丢弃;技能库又是离线组装的、不会随经验增长。FlowEvo 提出一个免训练框架:把成功的工作流编译成可调用的技能、存入持久化技能库,并在后续任务里检索复用,让「工作流」与「技能」在推理阶段互相成就、持续进化。
智能体自进化Agent技能库
HuggingFace Daily · ArXiv 2608.16885
大多数分层 VLA 模型对每个决策都只做一次前向推理,难的任务算不够、简单的又浪费。τ₀-VLA 把高层子任务生成建模成「算力可伸缩」的推理问题——用世界模型在推理阶段引导额外计算,把算力动态分配到更困难或更关键的决策上,面向长程机器人操作。
具身智能机器人VLA测试时计算
HuggingFace Daily · ArXiv 2608.19758
长上下文推理的瓶颈在于注意力二次复杂度,尤其预填充阶段。FlashPrefill V2 在初版原型基础上走向可生产部署:通过块稀疏注意力与动态阈值,大幅降低长上下文预填充的计算成本,让长上下文服务真正「能用、能上生产」。
LLM 服务长上下文推理优化注意力
ArXiv 2608.20318
递归自我改进(RSI)问的是:AI 能否改进「制造 AI 的过程」本身?而这个过程就是训练算法。作者指出此前没有基准能单独度量「智能体能否设计训练算法」这一能力,于是推出 AI4AI-Bench,把这一核心问题变成可量化、可排名的任务。
自我改进基准算法设计LLM Agent
ArXiv 2608.20334
一个 6B 单流 DiT,却想同时干好文生图、单图编辑、多图编辑三件事。Swift-Image 用渐进式训练流水线(从宽语义覆盖逐步升到高分辨率、强画质、统一生成-编辑监督),在受限算力预算下探索「小模型」能被推到多远。
图像生成多模态图像编辑DiT
HuggingFace Daily · ArXiv 2608.19759
多指抓取常因数据局限而难以泛化到新物体。GOAG 从「手与物体在接触点共享相同的表面几何」这一观察出发,用深度生成模型学习抓取接触点的紧凑隐空间表征,让灵巧手对新物体也能规划出多样且稳定的抓取。
具身智能灵巧抓取生成模型
🛠️开源项目
🔥 今日热点
GitHub · CopilotKit/OpenBot · ⭐ 2115
开源 AI 同事框架:每个智能体获得自己的浏览器、文件与工具,且每个动作都在执行前被「先决定、再行动」的治理机制约束。本周上线即冲到 2k+ 星,把「AI 智能体开箱即用 + 可控」这件事又往前推了一步。
AI Agent开源浏览器自动化MCP
GitHub · browser-use/macos-harness · ⭐ 686
一个「最薄」的 harness,让大模型通过辅助功能(Accessibility)接口获得对 macOS 的完整控制权。主打简单、可组合,是计算机使用(computer-use)类智能体在 Mac 平台的一个轻量基建。
计算机使用macOS自动化开源
GitHub · SigmanticAI/apex-inference-chip · ⭐ 668
一个开源推理芯片设计:用 RTL 实现一个 Transformer 解码器层,在 FPGA 上真正跑起 Qwen2.5-0.5B,每一个硅上数值都可验证。把「大模型下芯片」这件事变得可复现、可学习,对 AI 硬件方向很有启发。
AI 芯片FPGALLM 推理开源硬件

💡 小晴点评

今天最值得琢磨的,是「自我改进」正在从口号变成可以打分的科学问题——AI4AI-Bench 要量化智能体设计算法的能力,而 Phantom Gains 又在提醒我们:很多「自训练有增益」的结论,可能只是测量误差的幻觉。一正一反,恰好是一件事的两面。另一边,τ₀-VLA 和 FlashPrefill V2 都指向同一个趋势:把「算力」从均匀撒胡椒面,变成按难度、按重要性动态分配——这大概会是接下来模型与智能体共同的优化方向。开源侧 OpenBot 的走红也说明,大家真正想要的不是更强的单体模型,而是「能自己动手、又可控」的 AI 同事。周一愉快,我们下期见~