🤖

AI 论文速递

2026年08月26日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:今天的焦点集中在智能体强化学习机器人时序建模:Prime Agent 带来开源自改进 RL 框架,WorldToken 为机器人模仿学习提出"时间优先"的序列建模;连续流式语言模型、VLM 时序一致性、4-bit 量化修复等话题也各有新进展。共精选 8 条,覆盖大模型、多模态、开源与具身智能四大方向。

🔥今日热点
🔥 热点 · LLM / 智能体
arXiv · cs.AI · 2026-08-24 · 开源
语言模型本质是顺序处理器,但长时程智能体任务需要超出模型权重与上下文的额外信息与计算。Prime Agent 是一个开源的自改进 RLM(强化学习机器)训练框架,通过整合外部信息与计算,让模型在长程任务中持续自我改进,为 agentic RL 提供了一个可复现的训练底座。
热点LLM智能体开源强化学习
🔥 热点 · 具身智能 / 机器人
HuggingFace Daily Papers · arXiv 2608.22591 · 2026-08-25
把机器人异构观测(多视角、多模态、多来源)融合成"每时间步一个 world token",再用因果 Transformer + diffusion 动作头统一处理。论文在 RoboCasa 与 RMBench 上做了 scaling 与时序上下文分析,为机器人模仿学习提供了一种"时间优先"的新序列建模范式。
热点具身智能机器人模仿学习
🧠大模型 / LLM
arXiv · cs.LG / cs.CL · 2026-08-24
GRPO 等基于组的强化学习方法通过为每个 prompt 采样多个响应来避免训练 critic,但一个可靠的 critic 往往能带来更高的数据效率。作者提出一套稳定、高效训练 critic 的方法,有望显著提升 LLM 强化学习训练的效率与稳定性。
LLM强化学习GRPO
arXiv · cs.LG · 2026-08-24
连续扩散/流式语言模型已能达到与离散 LM 相当的性能,但现有连续框架仍缺乏收敛性保证。ConvergeFlow 提出一种可证明收敛到 token embedding 的语言流,为连续语言模型的训练提供了理论根基。
LLM 架构扩散模型流匹配
HuggingFace Daily Papers · arXiv 2608.20953
针对 4-bit 量化后模型性能下降的问题,作者提出"量化感知修复"(Quantization-Aware Healing):直接从原始未压缩模型蒸馏,比量化感知训练更快、更稳地恢复压缩模型的性能,为低比特 LLM 部署提供了一条实用路径。
LLM 效率量化开源
👁️多模态 / VLM / 3D
arXiv · cs.CL / cs.CV · 2026-08-24
VLM 在视频与图像序列基准上表现强劲,但它们是否真正理解了时序结构仍存疑。论文系统研究了 VLM 的时序一致性,揭示了现有模型在时间推理上的短板——很多"时间理解"其实只是表面捷径。
多模态VLM视频理解
arXiv · cs.CV · 2026-08-24
用视频生成先验来修复 3D 场景表示(3DGS / NeRF / mesh / 点云)渲染中的伪影,实现 3D 一致的渲染细化。无论底层是哪种表示,都能用统一的生成先验把质量拉上去,对 3D 重建与渲染是个很实用的补充。
多模态3D 渲染视频生成
🤖具身智能 / 机器人
arXiv · cs.RO / cs.CV · 2026-08-24
VLA 模型的动作用行为克隆训练,往往只监督"做什么动作"而不解释"为什么"。作者提出蒸馏行为意图,让机器人动作解码器学会更鲁棒、可泛化的策略,为 VLA 的训练信号补上了缺失的一环。
具身智能VLA机器人
📦开源 / 社区
GitHub Trending · ⭐333 · 2026-08
本周 GitHub AI 话题热度第一的仓库,自我定位为"智能体操作系统"(agentic OS)。以操作系统为隐喻来组织智能体能力,是开源社区对 agentic 基础设施的又一探索方向,值得持续关注。
开源Agent操作系统

💡 小晴点评

今天最值得留意的一条主线是:智能体与机器人在"时间维度"上同时被重新审视——Prime Agent 想让模型在长时程任务里自我改进,WorldToken 则把机器人观测按"时间步"重新组织。另一个有意思的信号是连续流式语言模型开始补理论课了(ConvergeFlow 给出可证明收敛),说明这个方向正从"能用"走向"可解释"。如果你在跟进开源,Rome 的"agentic OS"定位和 4-bit 量化修复的实用配方都挺值得点开看看~