📌 今日速览:今天是周一,arXiv 恢复上新(新一批 2609.04xxx)。今天的头号信号是「编译」——Compile by Training(HF 317↑)把自然语言规范直接编译成可复用的本地神经函数,摆脱对远程大模型的持续依赖;另一个反直觉结论来自 Random Attention(HF 163↑):KV cache 驱逐的打分信号几乎没用,随机驱逐就能和最强选择器打平、吞吐还更高。世界模型侧 Puffin-World(HF 66↑)把物理/几何/外观统一成原生 3D 世界状态;机器人侧 GIFT 用几何+可供性+目标引导中间特征,弥合「动作充分性鸿沟」。开源侧 short-video-generator-AI 一夜冲到 ★835,awesome 主仓库仍静默、AI list 排队继续拉长。
🔥今日热点
🔥 今日热点 · LLM 编译器
arXiv 2609.04199 · HuggingFace Daily Papers · HF 317↑
很多反复出现的文本函数「容易描述、却难用规则实现」,每次都调大模型又带来重复的成本、延迟和对服务商的依赖。这篇工作提出「训练式编译」(compile by training):把一段自然语言规范编译成一个可复用的神经函数——编译期由教师模型生成任务专属样例,用来训练一个挂在紧凑解释器上的小 adapter;编译出的函数脱离教师运行,还能像普通软件一样存储、版本化、组合调用。在 Program-as-Weights 快速编译器拿不到精确匹配的 FuzzyBench-Hard 子集上,训练式编译达到 83.6% 的语义准确率(代价是编译时间从秒级涨到约一分钟)。作者还把它部署成公开交互服务,演示了多站网站助手、语言控制的 3D 头像、英-克劳迪什双向翻译器。
LLM 编译器
HF 317↑
神经函数
软件工程
🔥 今日热点 · LLM 推理效率
arXiv 2609.03430 · HuggingFace Daily Papers · HF 163↑
长推理的 KV cache 是内存瓶颈,现有压缩方法清一色走同一范式:给每个 token 打个「将来重不重要」的分数、只留高分者。这篇工作给了一个反直觉结论——这个打分信号几乎没用。Random Attention 保留 prompt、在每个注意力头内部完全随机均匀驱逐,根本不算分;在 4 个模型、6 个推理任务上,它和最强驱逐器打平,vLLM 部署吞吐还高 32–43%。受控实验给出两层解释:①prompt 是 cache 里最脆弱的部分,不同选择器之间的差距几乎全在于「它们碰巧有没有保住 prompt」;②推理轨迹靠两层冗余自我保护(文本层面模型边走边复述还需要的内容、注意力头层面每个头各存一份副本),一旦 prompt 安全,随机抽到的副本就够用,根本不需要打分去挑。
KV Cache
HF 163↑
推理效率
反直觉
🧠大模型 & Agent
arXiv 2608.26730 · HuggingFace Daily Papers · HF 150↑
自主 post-training 系统会不断提出更新、训练候选、用评估反馈选下一个提案。随着证据累积,一个核心问题浮现:当后续训练已经改动了父模型后,过去的更新经验还有多少仍然有效?把历史成功当「无条件许可」可能白烧算力,被提升的子模型还可能拖累后续训练轨迹。作者把这个问题形式化为「条件经验迁移」,提出 BCIT:把观测到的效果绑定到来源上下文、检查适用条件、用命名硬冲突否决候选、必要时做一次有界训练试探获取当前状态证据。在金融推理、text-to-SQL、函数调用三个域上,BCIT 授权的有害更新更少、等算力下最终模型质量更高——把「经验授权」本身立成了一个独立问题。
自主训练
经验迁移
HF 150↑
后训练
arXiv 2609.04108 · HuggingFace Daily Papers
昨天 Rethinking OPD II 说蒸馏是「数据过剩、算法吃不饱」,今天这篇接着聊 OPD 与 RLVR 的关系。此前工作把 OPD 的密集 token 级监督当作稀疏 RL 奖励的补充,在单步内把两种信号融合(加权相加或教师调制缩放)。这篇工作发现一个简单的两阶段方案 OPD-then-RL 反而一致地赢过纯 OPD、纯 RLVR 和所有联合基线:OPD 先扩展学生对教师支持解的覆盖,RL 再在这个支持集内「磨尖」。联合优化反而让两种信号互相干扰。实操上,OPD 验证分数是「何时切到 RL」的关键信号,且 OPD 比 SFT 更适合做 RL 的冷启动。
蒸馏
RLVR
两阶段
推理
arXiv 2609.04094 · HuggingFace Daily Papers · HF 24↑
长程 agent 大多没有可编程的验证器,RLVR 用不上;多准则 rubric 是常用的替代奖励,但它是每整条轨迹只打一次分的标量,对几十步的过程来说信号太粗。DRACO 在训练中动态生成 rubric 来追踪策略能力,轨迹跑完给 rubric 打分,再把判断「重分配」到负责对应 rubric 的步骤上,在 GRPO 里产生逐步区分度的优势,且重分配是闭式解、不需要训练任何归因模块。在 AppWorld 上 DRACO 比基模高 15.9 分、比稀疏真值奖励训练的 GRPO 还高 5.3 分(自己不用任何验证器);在域外 Tau-Bench 上比基模高 5.3 分。代码开源。
信用分配
长程 Agent
GRPO
HF 24↑
💡 小晴点评
今天的 arXiv 有个特别戳人的巧合:Compile by Training 和 Random Attention,一正一反,都在说同一件事——「少依赖外部」。前者把 prompt 级的自然语言函数「编译」成本地小网络,后者告诉你推理 cache 里那套精心设计的打分其实多余。再配上昨天 Rethinking OPD II 的「数据过剩、算法吃不饱」,和今天 Knowing When Not to Reuse 的「经验不是无条件可复用」,感觉整个领域正在做一轮诚实的减法:把那些看似精巧、实则没贡献的机制一层层剥掉。世界模型/机器人那边,Puffin-World 和 GIFT 都指向同一条路——把物理、几何、可供性这些「结构」显式地注入表征,而不是指望更大的模型自己悟出来。开源生态里,awesome 主仓库的静默和门口 AI list 的长队,本身就是个信号:清单正在从「给人读」变成「给 agent 查」,审核标准还没跟上这股浪潮。