📌 今日速览:今天的头条,上海AI Lab 放出了一款 397B 的「科学 Agent 基础模型」Intern-S2-Preview,专治跨模态科学证据的长程推理;世界模型这条线格外热闹——Alaya-EVOKE 用「线性增长的监督」把交互式世界一路推到「无穷无尽」,DreamX-Phi 在机械臂操作的世界模型赛里拿了第一,PlayWorld 则反过来给这些世界模型出了套 171 关的「玩家质检」。信任与开源也没缺席:Dawn Song 团队的 Vero 逼着 Agent 连代码带证明一起交,丹麦团队用「只用可许可数据」训出 1B 的小钢炮 Mimir;开源圈里,一个给 Claude Code 画 29 种编辑级图表的小工具一天狂揽 3600+ 星。
🔬大模型 & Agent
🔥 今日热点
arXiv 2608.13505 · 2026-08-13 · HuggingFace Daily 42 upvotes
科学发现越来越需要一种 AI:能啃下异构模态的科学证据(图像、信号、音频、视频、3D 结构、轨迹、表格、公式、图……),能调用科学工具与环境互动,还能扛得住超长任务链。上海AI Lab 的 Intern-S2-Preview 正是为此而生——一个 397B 的科学 Agent 基础模型。它的训练分两段:先在「渲染后的科学文档 + 图文交错数据 + 海量科学语料」上做科学多模态预训练,再用一条统一的后训练管线(SFT → 可扩展多任务 RL → 黑盒/白盒 Agentic RL → 在线蒸馏)打磨。工程上很硬核:部分 rollout 加离策略修正、自适应长度正则、在线投机解码、鲁棒多任务优化。最妙的是它还留了个「Memory Decoder」后门——一个 4B 的记忆增强旁路,不动冻结的 397B 主干就能快速把模型特化到某个学科(生物学指令分数从 56.92 提到 60.32)。
科学 Agent
397B 基础模型
多模态
强化学习
arXiv 2608.13522 · 2026-08-13 · cs.LG / cs.AI / cs.SE
AI 编程 agent 越来越能干,但有一个致命短板:它不保证代码的正确性。Dawn Song 团队的思路是「验证式代码生成」——让 agent 交代码的同时,交一份机器可检查的证明。可现有基准要么只看单个函数、要么假设实现已经写好了只考证明,没人回答过一个真问题:agent 能不能在一个真实的多模块代码库里,把实现和证明都做对?Vero 是第一个仓库级基准:43 个多模块实例,来自 Python / Dafny / Verus / Coq 的真实项目,横跨密码协议到分布式系统。它甚至留了个「审计」机制,允许 agent 去证明「规格本身不成立」或「参考代码写错了」——反过来帮作者修掉了基准里的隐藏错误。结果很诚实:最强 agent 也只完整解出 43 题里的 27 题,最难的仓库一题没封顶。
形式化验证
代码正确性
Lean 4
安全
arXiv 2608.13560 · 2026-08-13 · HuggingFace Daily 31 upvotes
把一堆多模态素材压缩成一张结构清晰的海报,本质上是一个超长程的 agent 流程,核心在于那套「harness(脚手架)」设计得好不好。AutoDesign 提出:别让脚手架一成不变,让一个「元脚手架优化器」引导代码 agent,根据每次 rollout 的反馈递归地改进脚手架本身——像人类设计师一样在一次次试错里积累可复用的经验。它在「论文转海报」任务上做了 PosterBench(100 篇论文、5 大学科),拿到 78.32 分,比闭源商业系统 Claude Design 高出 7.45 分;在全自主长程循环里,40 分钟、不到 3 美元跑完 253 次工具调用和 11 轮编辑,海报质量达到「会议海报平均水平」。学到的 DesignHarness 挂到 7 种不同的代码 agent 配置上,平均分数从 54.99 涨到 67.39(+12.4%)。
Agent 设计
元优化
自改进
多模态生成
🌐多模态 & 世界模型
arXiv 2608.13546 · 2026-08-13 · HuggingFace Daily 82 upvotes
交互式世界模型有三座大山:持久记忆、即时响应、长程生成——而它们彼此打架:历史塞进 denoiser 上下文或 KV cache,成本随会话一路涨;想要低延迟又得靠少步生成,能力被 teacher 死死框住。EVOKE 干脆把两者都掀了:把持久世界状态「外置」到一个相机索引的世界状态库里,只按需取回与当前视角相关的那部分,上下文始终有界;同时把 teacher 从「固定生成器」重设计成能看长程的监督器——稀疏注意力混搭分块分组、选择性远帧检索、线性注意力全局状态,记忆与算力都只线性增长。结果是一个只需三步、无需 classifier-free guidance 的学生模型,1.5 秒一个 chunk(H200 上 2.11 秒),既能扛住长期漂移,又能随时响应 prompt 变化,在 WBench 上拿下 SOTA。标题里的「Endless World」不是噱头——它真的能一直演下去。
世界模型
长程生成
外部记忆
线性扩展
arXiv 2608.13552 · 2026-08-13 · HuggingFace Daily 33 upvotes
世界模型越做越像样,可比起来却是一笔糊涂账:人类玩家评估世界模型时,是带着长程目标去互动的——转个 360 度看环境还连不连贯、走到水里看涟漪真不真。可同样的目标,不同模型需要的动作序列各不相同,固定的「动作条件评估」根本没法横向比。PlayWorld 想了个巧招:让多模态 Agent 玩家替人类去和世界模型互动、追逐指定的长程目标,搭出一个 171 个场景的基准,从四个维度打分:几何一致性、交互保真度、视野外演化、洞察演化。拿 9 个最先进的世界模型一试,结论扎心:长程交互目标上大家都不太靠得住,尤其是空间一致性和状态持续演化。代码开源在 github.com/kxding/PlayWorld。
世界模型基准
Agent 评估
长程一致性
🔧开源进展
arXiv 2608.13517 · 2026-08-13 · cs.CL / cs.AI
如今的大模型几乎都建立在海量、常常不可许可的数据上,把守着开源与伦理底线的研究者挡在门外。丹麦基础模型团队(DFM)反其道而行:Mimir v1 是一个 1B 参数、基于 HRM(层级推理模型)架构、从头训练的小模型,后训练只用可许可数据(161 个数据集拼成)。结果却很能打:英语性能极具竞争力,丹麦语直接刷出新的 SOTA,在 20 个英/数/码/丹基准上,正面硬刚 Qwen 3.5 4B、Gemma 4 E2B 这些更大的前沿模型。模型已在 HF Hub 开源:huggingface.co/danish-foundation-models/DFM-Mimir。这是一份「不用灰色数据也能训练好模型」的漂亮声明。
开源模型
可许可数据
1B 小模型
HRM
GitHub Trending · cathrynlavery/diagram-design · ⭐17209(今日 +3646)
AI 生成图表的最大槽点,就是满屏「Mermaid 味」——布局僵、阴影糊、像 PPT 模板批量产出的。这个仓库反手给出了 29 种编辑级图表类型,全部是自包含的 HTML + SVG,不依赖任何框架,专为 Claude Code 等编码 agent 设计:直接吐干净、可控、能进设计稿的矢量图。项目页那句「No shadows, no Mermaid-slop」精准戳中了开发者审美,今天一天狂揽 3600+ 星,坐稳当日 Trending 榜首。它和 AutoDesign、Alaya-EVOKE 一起,勾勒出同一条暗线:Agent 的「输出审美」正在从「能看」进化到「能交付」。
开源
Claude Code
SVG 图表
设计交付
💡 小晴点评
今天最想拉着你聊的,是那条藏在「世界模型」三个字背后的暗流。Alaya-EVOKE 把记忆外置、让成本随会话只线性增长,换来「无穷无尽」的生成;DreamX-Phi 惦记的不是画得漂亮,而是别把抓着的杯子弄丢;PlayWorld 则冷冷地补了一刀——让 Agent 玩家转个 360 度、走进水里看看涟漪,九大世界模型就都露了馅。这三篇放一起,AI 正在从「能生成画面」迈向「能维持一个讲得通的世界」,这是往真正可交互的数字世界迈出的很实在的一步。
另一条线是「可信」。Dawn Song 团队的 Vero 问了一个特别朴素的灵魂拷问:Agent 写的代码,你凭什么信?答案是连代码带数学证明一起交——结果最强 agent 也只能啃下一半多,说明这条「验证式编程」的路还有得走,但方向是对的。而丹麦的 Mimir 用「只碰可许可数据」训出 1B 小钢炮,也让我有点触动:在「多就是好」的军备竞赛里,总得有人证明「干净的数据、克制的规模」也能打得漂亮。
至于那个一天 3600 星的 diagram-design,我倒觉得是今天最可爱的一条——它提醒我们,Agent 时代的价值不只在「多强大」,也在「多顺手、多好看」。当 AI 开始学会交付「编辑级」的干净图表时,它才真正从玩具变成了工具。周末愉快,慢慢看~