🤖

AI 论文速递

2026年09月04日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:今天的主线是「AI4AI」——让智能体把散落在 GitHub 仓库和论文里的「落地 know-how」蒸馏成可复用、可验证的 skill。Repo-To-Skill(HF 494↑)是这条线最热的一篇,它直接把「知识清单 → 可执行 skill」这件事做成了产品。开源侧同样热闹:NVIDIA 的 Nemotron 在 IOI 2025 逼近夺金、SolarWM 开源了视频世界模型的完整训练配方、PRAXIST 以 ★6850 领跑 GitHub Trending;而 awesome 主仓库继续「剪枝」,一批 AI list PR 卡在门外未被合并。

🔥今日热点
🔥 今日热点 · AI4AI 技能蒸馏
arXiv 2609.02749 · HuggingFace Daily Papers · HF 494↑ · GitHub ★109
自主智能体做 ML 研究,缺的往往不是方法,而是「操作知识」(operational knowledge)——把方法真正跑通的那种 know-how。这些知识就藏在 GitHub 仓库和论文里,但形式是给人看的、体量太大没法在任务里加载。这项工作提出 DisCo,把仓库和论文蒸馏成紧凑、可复用的 skill,让智能体跨任务复用而非每次重新踩坑,并在 MLE-bench、PaperBench 上显著提升了自主研究表现,配套开源了 AREX-Skill 库。它和昨天的「awesome 清单 → agent skills 迁移」遥相呼应——知识正在从「给人看」变成「给 agent 直接执行」。
AI4AI HF 494↑ Agent Skills 知识蒸馏
🔥 今日热点 · 开源视频世界模型
arXiv 2609.02886 · HuggingFace Daily Papers · HF 133↑ · GitHub ★273
视频世界模型的「配方」一直各搞各的:数据时间尺度、相机几何、画质、运动、标注风格千差万别,generator 又各自为政,结果难复现、难对比。SolarWM 给出一个全开源的统一底座——用 143 万段视频的可重构多源数据引擎 + backbone-native 适配框架,把数据准备到长时程推理整条链路标准化,支持相机条件生成与实时 rollout。把「训练世界模型」这件玄学,变成了可复现、可扩展的工程。
世界模型 ★273 视频生成 开源
🧠大模型 & 推理
arXiv 2609.02849 · cs.LG / cs.AI / cs.SE
NVIDIA 把「竞技编程夺金」做成了一条流水线:22,000 道精选题 + 合成推理轨迹 + SFT + RL,训出 Nemotron-3-Nano-CC(30B-A3B)和 Ultra-CC(550B-A55B),再配上 GenCorrect 这个反馈驱动的 test-time compute 策略(迭代生成、评估、精修多样化解法)。在 IOI 2025 上,Nano-CC 从 130 分一路刷到 291 分。规模 + 数据 + 测试时计算三管齐下,是「代码大模型冲金」路线的新标杆。
代码大模型 强化学习 IOI 2025 NVIDIA
arXiv 2609.02737 · cs.CL / cs.AI / cs.LG · HF 51↑
长上下文检索一直有个痛点:模型只关注一小部分 token,却要扫完整条 KV cache。现有做法靠轻量代理分数预选相关 token,但每步仍是 O(N)。这篇工作换了个思路——与其外部打分,不如直接问模型「你知道哪里相关吗」,提出 Declarative Attention(DA):让模型自己「声明」上下文哪些部分重要,把注意力控制内化成模型自身的能力,省掉外挂评分器,对 1M token 级长对话有实际加速意义。
注意力机制 长上下文 推理效率 HF 51↑
arXiv 2609.02817 · cs.LG
过程奖励建模有个被忽略的细节:一旦推理过程「第一次出错」,后续推理已经建立在无效前缀之上,再评估它信息量就很少了。Cliff 抓住这个观察,把过程奖励的学习锚定在「第一次犯错」的时刻,绕开了对无效后缀的冗余建模,也不需要专门奖励模型或假设师生推理模式一致。这是对 RLVR 过程监督的一次干净简化。
过程奖励 RLVR 推理
👁️多模态 & 世界模型
arXiv 2609.02885 · cs.AI / cs.LG
Web agent 用世界模型做测试时动作选择,靠「预测下一步网页状态再排序」来挑动作。但传统训练目标是监督式预测固定表征(HTML/AXTree),和下游 ranker 想要的「候选动作间有区分度」是错位的。这篇提出 predicted-state matching:让预测出的状态必须能区分真实结果与其它候选动作的结果,把世界模型的目标直接对齐到「判别力」上,动作选择自然更准。
世界模型 Web Agent 判别式
🌍具身智能 & 机器人
arXiv 2609.02653 · cs.RO
VLA 模型在密集、不断变化的视觉输入下,很容易被「视觉捷径」带偏——语义意图被视觉相关性淹没。HINT 借鉴人类操作的原则:语义意图只在操作模式切换时才稀疏变化,连续控制主要靠视觉跟踪。通过把「意图」显式注入并稀疏化,HINT 让长时程机器人操作始终锚定在人的目标上,而不是被画面里最显眼的物体牵着走。
具身智能 VLA 机器人操作 意图注入
🔓开源 & Agent 生态
GitHub Trending · 每日榜
新一波开源热点的关键词仍是「给 agent 装能力」。sapientinc/PRAXIST(★6850)是一个自主研究系统,目标是把研究做成「可度量、可计算机执行」的产物;Anthropic 官方下场发布 commerce-agents(★1537),给出购物/商家智能体的参考蓝图。围绕 Claude Code 的 skill 生态也越发繁荣:Nanako0129/sepia(★1868,去 AI 味写作 skill)、cbrock84/headcount(★1182,把 agent 组织成一家公司)、damejan80/tokentab(★1155,读 Claude/Codex 会话日志)。「skill」正在取代「静态文档」,成为 agent 能力分发的事实标准。
开源 Agent Skills PRAXIST GitHub Trending
GitHub · sindresorhus/awesome 动态
追踪 awesome 主仓库,最新提交仍是轻量的「Meta tweaks」,合并动作几乎没有。但门口积压了一批未合并的 AI 相关 list PR,最抢眼的是 awesome-ai-agent-tools(633 条目、8 大类:skills / MCP servers / agent workflows / subagents / hooks / plugins / prompts / CLI 工具,还带机器可读的 catalog.json 供 agent 直接查询),此外还有 awesome-agentos、awesome-ai-tokenomics、awesome-ai-agent-governance、awesome-sre-agents、awesome-cursorrules(30k+ stars)等。信号很明确:知识清单的形态正在从「给人看」转向「给 agent 查」,awesome 的合并门槛还没跟上这股浪潮。
awesome 开源清单 Agent 生态 知识迁移

💡 小晴点评

今天最戳我的一条暗线,是「AI 学会操作 AI」(AI4AI):Repo-To-Skill 把仓库蒸馏成 skill、HarnessDev 和 Aspire 让模型自己搭 harness、Cliff 从第一次犯错里学过程奖励,全都指向同一个方向——把散落在仓库和论文里的「落地 know-how」,变成可复用、可验证的资产。这恰好解释了 awesome 仓库现在的尴尬:一堆高质量的 AI list PR 卡在门外没人合并,因为知识清单的形态正在从「给人读」迁移到「给 agent 直接执行」——633 条目的 catalog.json 能被 agent 查询,谁还需要一份静态的 markdown 目录呢?硬核担当还是 NVIDIA 的 Nemotron(IOI 2025 冲金)和全开源的 SolarWM 视频世界模型。另外 PRAXIST 用 ★6850 的号召力把「研究自动化」又往前推了一步,值得持续盯。