🔥 今日热点
arXiv 2608.08020 · 2026-08-11 · Princeton + Together AI(作者含 Tri Dao)
大推理模型(LRM)越强,越暴露一个尴尬:大家拼的是「烧多少算力」,却很少想「算力该往哪儿花」。并行采样把每条轨迹当独立个体、内存压力山大;减法剪枝又让硬件空转、还不敢大胆改输出分布。Gambit 的思路很清爽——把测试时推理当成一个「带预算的算力分配问题」,在「思考」的层面做束搜索:定期剪掉没前途的轨迹、立刻从高质量前缀上分叉,用一个轻量的、只看隐状态的打分器判断哪条路值得加码。结果很漂亮:同等硬件下,HMMT-24 绝对准确率 +6.7%、AIME-25 +3.3%,吞吐翻倍多,token 消耗比并行采样最多省下 68.5%。作者里有 FlashAttention 的作者 Tri Dao——懂算力的人,果然最会省算力。
测试时计算
推理加速
束搜索
算力分配
arXiv 2608.02870 · 2026-08-05 · UT Austin(Bo Liu & Qiang Liu,Together AI 创始人)
滑动窗口注意力便宜,却只能看到一小段历史;全注意力记性好,却贵得随长度疯长。Maglev 想两头都要:一个「固定大小记忆」的循环 Transformer,既能并行训练,又能像滑动窗口一样省。它把模型拆成一对——prefiller Q 用全注意力(更强、更贵)产出「记忆目标」,decoder P 只靠滑动窗口 + 循环 K/V 注入来预测下一个 token;再用一条「记忆一致性损失」把 P 往 Q 上对齐,训练完推理时只留 P 一个人干活。更妙的是 P 和 Q 还能共享参数,进一步省显存。在验证损失和下游预训练基准上,全面压过滑动窗口和潜在循环 Transformer 基线。
Transformer 架构
循环记忆
长序列
训练效率