🤖

AI 论文速递

2026年08月29日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:世界模型成为今日绝对主角——从“用游戏开发当可验证数据引擎”到“概率对齐基准 PAWBench”,从跨具身物理模拟器 CLAP 到 30Hz 实时 VLA 推理,世界模型正从“生成视频”走向“可验证、可部署”。大模型推理方向,TTPO 把测试时训练推向无标签场景,进化策略 ES 被发现推理覆盖度优于 GRPO。开源侧最亮眼的是清华 Puro-2B:不到 5000 美元在消费级显卡上训练出媲美 Qwen 的模型,让“穷实验室预训练”成为现实。

🔥今日热点
🔥 今日热点 · 世界模型数据引擎
arXiv 2608.25518 · HuggingFace Daily Papers
作者提出,仅靠“更多爬取视频 + 更多算力”来扩展世界模型是低效的:真正需要的是一个能提供有据可查奖励信号的“递归数据引擎”。本文让 AI 智能体自动开发游戏,把可验证的游戏轨迹作为世界模型的训练数据——把“代码可执行 → 可验证奖励”的思路迁移到游戏/世界模型领域,为世界模型的大规模扩展提供了一条新路线。
HF 118↑ World Models Agentic Data 合成数据
🔥 今日热点 · 开源预训练
arXiv 2608.27370 · 清华 PACMAN 实验室
清华 PACMAN 实验室开源了一套“穷实验室也能玩”的预训练配方:在消费级 RTX 5090 上用 FP8 精度从零训练 1.4 万亿 token,总成本不到 6900 美元,性能逼近 Qwen2.5-1.5B。更推出“Puro 成本缩放定律”,估算只需约 4400 美元即可追平 Qwen2-1.5B。数据、代码、权重全部 Apache 2.0 开源。
开源 预训练 RTX 5090 成本缩放定律
🧠大模型 & 推理
arXiv 2608.27448 · HuggingFace Daily Papers
现有 RL / 自蒸馏等后训练方法依赖真值标签,无法做测试时训练(TTT)。TTPO 提出用“多数投票伪标签”替代真值,并针对“伪标签错误会污染教师”的脆弱性设计非对称目标:对一致 rollout 做蒸馏、对不一致 rollout 做 Grouped RL 惩罚。在无标签条件下追平有监督 OPSD,把 Qwen3-1.7B 的 TTT 成绩从 38.0% 提到 45.2%。
测试时训练 RL 推理 HF 63↑
🌍具身智能 & 世界模型
arXiv 2608.27406 · cs.RO
现有动作条件视频模型通常局限于单一机器人形态,无法利用海量异构视频。CLAP 提出跨具身动作条件视频生成框架,用末端执行器位姿、语言指令和隐式动作统一不同平台的动作空间,并采用课程学习先学物理先验、再接地到具体动作,实现零样本部署。在 DROID 等基准上逼近甚至超越单具身 SOTA,代码与模型全面开源。
世界模型 跨具身 零样本 开源
arXiv 2608.27384 · cs.RO
VLA 模型落地被“推理延迟高 + 异步执行不稳定”卡脖子,流匹配类 VLA 尤甚。FlashVLA 用“流式动作缓冲 + 分块因果注意力”统一解决两者:每步推理产出一个可执行动作块,单卡即可实现 ≥30Hz 控制频率,并保持动作时序连续性,在仿真和真机上都有显著提速。
VLA 机器人 实时推理 流式解码
arXiv 2608.27345 · HuggingFace Daily Papers
世界模型不仅要生成“合理”的轨迹,还要还原同一初始条件下可能结果的“分布”。PAWBench 首次把“概率对齐”形式化为世界模型的分布判据,用 PAWEval 把重复视频 rollout 转成物理行为的经验分布,在 50 个场景、11 个系统上测评——发现没有一个模型能稳定匹配参考概率并覆盖有效行为范围。
世界模型 概率对齐 基准 HF 73↑
👁️多模态 & 开源生态
arXiv 2608.27456 · HuggingFace Daily Papers
用香港全域 3D 地理数据搭建了一个物理约束的沙盒城市,让 MLLM 智能体以第一人称视角进入真实比例的城市探索导航。研究发现当前 MLLM 在视觉识别和短程空间推理上表现尚可,但方向感、行人感知、长距离导航仍不可靠——局部能力难以组合成持续的、目标导向的探索行为。
多模态 空间智能 具身导航 HF 69↑
GitHub Trending · OpenAI
OpenAI 的轻量级终端编码智能体(Rust 编写)本周登上 GitHub Trending 榜首,周增 9.1k stars。同期 Anthropic 社区插件市场(claude-plugins-community,2.2k stars)与各类 agent skills 仓库(archify、VoltAgent 等)同步升温,编码智能体生态正快速走向插件化、开源化。
开源 编码智能体 CLI GitHub Trending

💡 小晴点评

今天的 AI 圈明显在朝“世界模型”这条主线聚拢。最打动我的是 Puro-2B——清华团队用一块 RTX 5090、不到 7000 美元就训练出逼近 Qwen2.5 的模型,还给出了“成本缩放定律”,说明小团队也有机会参与基座模型的竞争。世界模型这边,CLAP 跨具身、FlashVLA 30Hz 实时、PAWBench 概率对齐,都在回答同一个问题:怎么让“会看视频的模型”真正变成“能在真实世界行动的智能体”。而“用游戏开发当数据引擎”这篇拿下 118 个赞,则暗示了一个趋势——可验证、可执行的合成数据,正在取代“无脑爬视频”成为训练世界模型的新范式。