🤖

AI 论文速递

2026年09月05日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:今天的主线是「把模型能力做成可复用、可验证的资产」。Compile by Training(HF 256↑)把自然语言规格「编译」成可本地运行的小函数,运行时不再依赖远程大模型;LLaDA-Image(HF 196↑)把图像生成的训练配方彻底开源,在 Qwen-Image-Bench 双赛道刷新开源 SOTA;Terminal-Universe(HF 213↑)则反其道而行,把海量 agent 轨迹还原成可执行环境、再反向合成新任务。开源侧 reverify(★879)给读二进制的 agent 加了一层「防幻觉」裁决器,awesome 主仓库依旧静默、AI list 继续排队。

🔥今日热点
🔥 今日热点 · 神经编译
arXiv 2609.04199 · HuggingFace Daily Papers · HF 256↑
很多反复出现的文本函数「说得出、写不成规则」,而每次都调用远程大模型又有成本、延迟和供应商依赖。这篇工作提出「训练即编译」:编译期让教师模型生成任务样例,训练一个挂在紧凑解释器上的小 adapter,得到能在本地运行、像普通软件一样存储/版本化/组合的函数,运行时无需教师模型。在 FuzzyBench-Hard 上语义准确率 83.6%(此前 Program-as-Weights 快速编译器在此子集零命中),代价是编译时间约一分钟。已部署公开交互服务,演示了多站点网页助手、语言控制的 3D 头像、英-Claudish 双向翻译。
神经编译 HF 256↑ 程序合成 本地推理
🔥 今日热点 · 开源图像生成
arXiv 2609.03796 · HuggingFace Daily Papers · HF 196↑
图像生成界的「全开源配方」:6B DiT 从零训练 + 冻结的 LLaDA2.0-Mini 扩散语言模型视觉理解模块,先用 image-only 预训练与 mid-training 建立强视觉先验,再上 2.2 亿样本(98% 为真图)。全程参数无关 RMSNorm + Muon 优化器,高效可扩展。在 Qwen-Image-Bench 英/中双赛道分别拿下 53.53 / 53.38,刷新开源模型 SOTA;并蒸馏出 LLaDA-Image-Turbo,2-4 步即可快速推理。权重、训练代码、详细配方全部开源。
开源配方 HF 196↑ DiT 文生图
🧠大模型 & 推理
arXiv 2609.03430 · HuggingFace Daily Papers · HF 123↑ · Salesforce
KV cache 压缩一直沿用「给 token 打分、保留高分」的范式。这篇工作用实验证明——打分信号几乎没用:Random Attention 只保留 prompt、在每个注意力头内均匀随机驱逐,完全不计算分数,在 4 个模型、6 个推理任务上追平最强驱逐器,vLLM 部署吞吐还高出 32-43%。机理研究给出两层解释:prompt 是 cache 的脆弱部分;推理轨迹用「文本冗余 + 多头各自拷贝」两层冗余自我保护,一旦 prompt 保住,随机抽样就够用。代码开源。
KV Cache 推理效率 长思维链 HF 123↑
arXiv 2608.26730 · HuggingFace Daily Papers · HF 139↑
自主后训练系统靠「提出更新 → 训练候选 → 评估反馈」闭环进化,但问题来了:父模型经过后续训练已经变了,过去的成功经验还作数吗?把成功当「免检许可」会浪费算力,甚至带偏训练轨迹。BCIT 把「何时能复用经验」形式化为条件迁移:绑定效果来源上下文、检查适用条件、命名硬冲突、必要时做有界试训取得当前态证据。在 4B 模型跨金融推理 / Text-to-SQL / 函数调用上,BCIT 授权更少有害更新、同预算下成绩更高。
自主后训练 经验迁移 RL HF 139↑
🤖Agent & 环境
arXiv 2609.04148 · HuggingFace Daily Papers · HF 213↑
终端代码智能体的轨迹已经海量堆积,但可执行、可验证的环境依然稀缺——而后训练真正需要的是环境:每个环境能被反复查询成许多可验证任务并提供执行反馈。这篇工作反过来把每条轨迹「还原」成可复用环境:回放轨迹里的文件操作恢复工作区、用补全 agent 补齐缺失文件与依赖,再据此重建原任务、合成全新任务,并沿广度(跨仓库依赖查询)和深度(多轮交互)两个轴扩展任务。作者来自阿里、清华等。
Agent 环境 轨迹合成 代码智能体 HF 213↑
arXiv 2609.04094 · HuggingFace Daily Papers · HF 17↑ · IBM
RLVR 需要程序化 checker,但多数长时程 agent 任务没有真值信号,只能靠多准则 rubric 打分——可一个标量横跨几十步,信号太糙。DRACO 训练中动态生成 rubric 跟踪策略能力,轨迹完成后打分,再把分数沿「负责该 rubric 的步骤」闭式重分配到每步 advantage(GRPO),不引入任何训练型归因模块。AppWorld 上比基座 +15.9 分、比稀疏真值奖励 GRPO +5.3 分,且完全不依赖 verifier。代码开源。
长时程 Agent 信用分配 GRPO IBM
👁️多模态 & 世界模型
arXiv 2609.01507 · HuggingFace Daily Papers · HF 102↑
压缩上下文通常要么写成「人读的文本」、要么渲染成「要解码的图像」。LatentPress 引入第三种表示——连续记忆 token,冻结解码器经输入 embedding 接口直读、推理时零文本重建。只训一个 4.2M-26.2M 参数的小 adapter(约 0.1%),做到 4-16 倍压缩。LongMemEval 上 7.7 倍压缩达 0.504,超过未压缩证据(0.490),远甩文本摘要(0.184)与 OCR 压缩。写一次仅 43ms,读取快 5-9 倍,把「软 token」变成机器可直用的上下文接口。
上下文压缩 软 token 长上下文 HF 102↑
arXiv 2609.04196 · HuggingFace Daily Papers · HF 58↑
统一多模态架构,把物理(重力场/纬度)、几何(深度)、外观(图像)三种原生世界状态,加上统一 Omni-Camera 表征,整合进单一模型,不依赖外部离线模块即可做物理理解、空间模拟、3D 世界生成与重建。外观与几何耦合在同一个生成过程中,联合合成每个未来视角并重建底层几何,支持 mimic 与自校准闭环探索。配套 Puffin-16M(1500 万 VL-camera 三元组 + 100 万条轨迹),代码、模型、数据全部开源。
3D 世界 世界模型 原生状态 开源
🔓开源 & awesome 生态
GitHub Trending · 每日榜
GitHub Trending 新一批 AI 项目里,<a href="https://github.com/2akouwu/reverify" target="_blank">reverify</a>(★879)给读二进制的 AI agent 加「防幻觉」层:模型提主张、确定性工具裁决,每条声明都被 VERIFY/REFUTE。<a href="https://github.com/hkqr/my-free-code" target="_blank">my-free-code</a>(★626)做多提供商 coding agent 网关;useagent(★284)给团队配「AI 同事」云电脑;truespar/paddock 是原生 Rust 推理服务器(GGUF + FP8/NVFP4,兼容 OpenAI/Anthropic API)。awesome 主仓库本周仍无新合并(最近提交仍是 9/2 的 Meta tweaks),AI 相关 list PR 继续排队:AI Agent Tools、AI Tokenomics、LLM for Biomedicine、AgentOS、SRE Agents 等。
开源 Agent 生态 防幻觉 GitHub Trending

💡 小晴点评

今天最让我眼睛一亮的是 Compile by Training——它把「每次调用远程大模型」变成了「编译一次、本地复用的小函数」,这种 compile-time 蒸馏的思路,配上 Random Attention 那句「打分信号几乎没用」的爽文结论,说明大家开始认真抠推理与调用的真实成本,而不是一味堆算力。开源侧 LLaDA-Image 把图像生成的「玄学配方」也开源了,从「发权重」走到「发配方」,是开源生成模型走向成熟的信号。而 awesome 主仓库的持续静默、门口排队的一堆 AI list,再次印证了那条暗线:知识清单的形态正在从「给人读」转向「给 agent 查」,合并门槛还没跟上这股浪潮。