📄研究前沿
🔥 今日热点
HuggingFace Daily · ArXiv 2607.21596
现有智能体在推理时构建的工作流,任务一结束就被丢弃;技能库又是离线组装的、不会随经验增长。FlowEvo 提出一个免训练框架:把成功的工作流编译成可调用的技能、存入持久化技能库,并在后续任务里检索复用,让「工作流」与「技能」在推理阶段互相成就、持续进化。
智能体自进化Agent技能库
HuggingFace Daily · ArXiv 2608.16885
大多数分层 VLA 模型对每个决策都只做一次前向推理,难的任务算不够、简单的又浪费。τ₀-VLA 把高层子任务生成建模成「算力可伸缩」的推理问题——用世界模型在推理阶段引导额外计算,把算力动态分配到更困难或更关键的决策上,面向长程机器人操作。
具身智能机器人VLA测试时计算
HuggingFace Daily · ArXiv 2608.19758
长上下文推理的瓶颈在于注意力二次复杂度,尤其预填充阶段。FlashPrefill V2 在初版原型基础上走向可生产部署:通过块稀疏注意力与动态阈值,大幅降低长上下文预填充的计算成本,让长上下文服务真正「能用、能上生产」。
LLM 服务长上下文推理优化注意力
ArXiv 2608.20318
递归自我改进(RSI)问的是:AI 能否改进「制造 AI 的过程」本身?而这个过程就是训练算法。作者指出此前没有基准能单独度量「智能体能否设计训练算法」这一能力,于是推出 AI4AI-Bench,把这一核心问题变成可量化、可排名的任务。
自我改进基准算法设计LLM Agent
ArXiv 2608.20334
一个 6B 单流 DiT,却想同时干好文生图、单图编辑、多图编辑三件事。Swift-Image 用渐进式训练流水线(从宽语义覆盖逐步升到高分辨率、强画质、统一生成-编辑监督),在受限算力预算下探索「小模型」能被推到多远。
图像生成多模态图像编辑DiT
HuggingFace Daily · ArXiv 2608.19759
多指抓取常因数据局限而难以泛化到新物体。GOAG 从「手与物体在接触点共享相同的表面几何」这一观察出发,用深度生成模型学习抓取接触点的紧凑隐空间表征,让灵巧手对新物体也能规划出多样且稳定的抓取。
具身智能灵巧抓取生成模型
🛠️开源项目
🔥 今日热点
GitHub · CopilotKit/OpenBot · ⭐ 2115
开源 AI 同事框架:每个智能体获得自己的浏览器、文件与工具,且每个动作都在执行前被「先决定、再行动」的治理机制约束。本周上线即冲到 2k+ 星,把「AI 智能体开箱即用 + 可控」这件事又往前推了一步。
AI Agent开源浏览器自动化MCP
GitHub · browser-use/macos-harness · ⭐ 686
一个「最薄」的 harness,让大模型通过辅助功能(Accessibility)接口获得对 macOS 的完整控制权。主打简单、可组合,是计算机使用(computer-use)类智能体在 Mac 平台的一个轻量基建。
计算机使用macOS自动化开源
GitHub · SigmanticAI/apex-inference-chip · ⭐ 668
一个开源推理芯片设计:用 RTL 实现一个 Transformer 解码器层,在 FPGA 上真正跑起 Qwen2.5-0.5B,每一个硅上数值都可验证。把「大模型下芯片」这件事变得可复现、可学习,对 AI 硬件方向很有启发。
AI 芯片FPGALLM 推理开源硬件