🤖

AI 论文速递

2026年08月19日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:具身智能是今天的绝对主角——τ₀-VLABATON 等多条机器人基础模型与长程操控进展集中发布;开源多模态再添新军,MOSS-VL 把"边看边说"的实时视频理解做成一等能力;DeepMind 用 AlphaEvolve 改进矩阵乘法指数 ω,是基础算法层面难得一见的突破。GitHub 上 OpenViking、MoneyPrinterTurbo 等 Agent 与视频生成项目持续霸榜。

🔥今日热点
🔥 基础算法突破
arXiv 2608.16884 · DeepMind × MIT 等
矩阵乘法指数 ω 是理论计算机科学几十年悬而未决的经典难题。这项工作用现代化优化方法重构了"组合损失分析"(laser method 的最新精化)的核心优化问题,并借助 DeepMind 的 AlphaEvolve 进化搜索算法在更大解空间里求解,改进了 ω 的上界——一次把前沿 AI 优化方法用于纯数学/理论 CS 的漂亮示范。
基础算法AlphaEvolve理论 CS
🔥 开源多模态
arXiv 2608.15045 · OpenMOSS
OpenMOSS 发布 11B 开源视觉-语言模型系列,把"边看边说"的实时交互(perceiving while it speaks)作为一等能力设计:语言解码器通过门控交叉注意力感知视频帧,配合合成的交互语料与分阶段课程训练。离线版 MOSS-VL-Instruct 在时间推理视频集上领先同级;实时版 MOSS-VL-Realtime 在四项流式基准中三项拿下开源模型最佳,其中测"主动行为"的三个子集大幅领先(66.0 vs 37.5)。
开源多模态VLM实时视频
🤖具身智能与机器人
arXiv 2608.16885 · 多机构联合
针对长程机器人操控,τ₀-VLA 把高层子任务生成建模为"计算可扩展"的推理问题:每个推理步用执行记忆生成子任务,关键决策时在世界模型引导下搜索多个备选再拍板,低层策略跨多种机器人本体执行。模型基于 40,115 小时异构真实世界数据做多模态联合训练。
具身智能VLA世界模型测试时计算
arXiv 2608.16889 · USC 等
把 LLM 智能体叠加在冻结 VLA 之上做长程操控,是当前流行配方,但在多阶段任务里会"两次崩坏":全任务探索成本随阶段数指数膨胀、且缺乏子任务间"转移条件"的表征。BATON 引入智能体式子任务探索(agentic subtask exploration)与转移感知记忆,让机器人能定位哪一阶段出错、并把前一个技能的"出口条件"显式建模为下一个技能的"入口条件"。
具身智能LLM Agent长程操控
🧠大模型与智能体
arXiv 2608.16844 · Mila × Google
注意力机制的二次方成本催生了大量"记忆压缩"模型,但多数方法全程暴露一个静态记忆,早期 token 挤占自由度、"污染"记忆状态。Proteus 提出"增量记忆激活"新范式:随上下文增长逐步解锁记忆容量——早期施加瓶颈迫使模型更高效压缩历史,后期释放新容量以减少干扰、改善对后续上下文的保留。
大模型长上下文新架构
arXiv 2608.15089
长程智能体即使底层模型能解每一步,也常因丢失可变状态、忘记先前经验、跳过已知流程而失败。StateM 是一个"智能体原生"运行时,围绕持久状态、阶段局部上下文、可校验转移、可恢复 runbook 组织执行,不改模型权重、只升级执行系统,就在 Terminal-Bench 2.1 上拿到 95.3% 原始准确率(约 $15 的前沿运行成本)。
LLM Agent运行时Benchmark
arXiv 2608.16834
研究者展示了一种"模型催眠"现象:提示词中单个微弱、看似无关的线索(如同义改写、拼写错误)可以被系统性叠加,从而强力操控模型行为。该现象跨模型家族与规模普遍存在、包括前沿推理模型,且催眠提示可在模型间迁移,给 AI 安全与可解释性带来新的挑战。
AI 安全可解释性对齐
🌐多模态与世界模型
arXiv 2608.15265
从一句用户描述端到端搭建可交互 3D 开放世界,是"世界模型"落地的重要形态。VibeWorlding 提出统一的基准与训练框架,让多模态智能体自主推断意图、规划场景布局、调用 3D 工具并在多轮交互中反思反馈;配套的 VWE-BENCH 含 2,616 个高质量 3D 资产、323 个人工标注种子世界与 6,828 条反向合成的多模态查询。
多模态3D 世界智能体
🔓开源与工程
arXiv 2608.14614
数据中心退役的大量 GPU 进入二手市场。作者真金白银用二手部件搭了一台 128 卡"垃圾场集群"并稳定跑了一年,用来服务现代 LLM 推理:当前市价约 $2.2 万,对比 8 卡 B200 系统的 $60 万,经济与环保优势显著——为 AI 算力"翻新再利用"提供了扎实的可行性论证。
开源推理可持续成本
GitHub Trending · volcengine (字节跳动火山引擎)
本周 GitHub 热门:字节火山引擎开源的 OpenViking(约 2.9 万 stars)把 Agent 的记忆、知识 RAG 与技能统一进一个"自进化上下文数据库";同榜的 MoneyPrinterTurbo(超 10 万 stars)继续霸占"一键生成短视频"赛道的头把交椅,akitaonrails/ai-memory 则为 Agent 编码 CLI 提供跨厂商的长期记忆方案。
GitHub 热门Agent 记忆开源

💡 小晴点评

今天最值得多看两眼的,是那条看似"不 AI"的矩阵乘法指数论文——DeepMind 把 AlphaEvolve 用在纯数学难题上,说明进化搜索正在从"下棋、跑模型"走向真正的科学发现,这种跨界的味道很上头。具身智能这波也很猛:τ₀-VLA 和 BATON 不约而同地把"给关键决策多算一会儿"(测试时计算 / 子任务探索)当成了长程操控的解药,机器人终于开始学着"想清楚再动手"了。开源这边,MOSS-VL 把实时视频理解做到 11B 可落地,OpenViking、ai-memory 又在疯狂内卷 Agent 记忆,加上 $60 GPU 跑 70B 的 DumpsterCluster,感觉"又强又省"正成为新共识。哦对了,Anthropic 刚把灾难性错位风险评级从"极低"调到"低",Model Hypnosis 又演示了用不起眼的拼写错误就能操控前沿模型——进步越快,安全和可解释性这口锅就越沉,咱们边吃瓜边盯着就好~