🔬大模型 & 推理
🔥 今日热点
arXiv 2608.09888 · 2026-08-10 · HuggingFace Trending #1(552 upvotes)
一个只有 1.5 亿参数的小模型,却在 ARC-AGI-1 上打破了成本-精度的帕累托前沿:29.5% 的 pass@2,单任务推理成本仅 0.0007 美元。它的妙处在于「只做不说」——输入不断更新模型的循环记忆,然后在高维潜空间里迭代计算求解,全程不吐露任何中间推理步骤(CoT)。相比那些靠堆算力、吐长链的推理模型,BDH-CQ 展示了一条「藏起思维、只给答案」的性价比新路线,也为思考过程的隐私保护提供了新思路。
推理模型
潜空间推理
ARC-AGI
性价比 SOTA
arXiv 2608.06296 · 2026-08-09 · HuggingFace Trending #2(185 upvotes)
「自我蒸馏」听起来很美,但现有方法总得偷偷借外力——要么靠真值标签,要么靠更强的教师模型。U-OPSD 把这个最后的依赖也砍掉了:让模型自己采样多条 rollout,用多数投票构造「伪解」,再专门在那些「自信却错了」的补全上自我蒸馏、精准纠错。在 AIME24/25、MATH500 等五个数学基准上,4B/8B 的 Qwen3 分别提升 8.5% 和 10.7%,平均超越监督式 OPSD 达 3.2%,与 GRPO 打成平手甚至略胜。代码已开源。
LLM 后训练
自我蒸馏
无监督
数学推理
arXiv 2608.07594 · 2026-08-06
可解释性长期被当成「能力的税」:先训一个黑箱,再事后费劲地逆向解释。这篇工作反其道而行——把可解释性直接作为训练约束,和语言建模目标一起优化。横跨三个数量级的算力、自回归和扩散两类模型,结论一致:可解释性随规模一起变强,而不是此消彼长。作者据此训出 Steerling-8B,一个扩散语言模型,能把任意生成 token 归因到相关输入、人类可理解的概念和训练数据上,还能「诊断→检索→概念引导纠偏」闭环修正,无需重新训练,性能却不输用 2-16 倍算力训出的同行。
可解释性
扩散语言模型
概念引导
Scaling Law
🌐多模态 & 4D 生成
arXiv 2608.10744 · 2026-08-11 · HuggingFace Trending(103 upvotes)
从文字/图片直接生成「动态 3D 世界」是当下最难的生成任务之一。现有路线要么「先出视频、再重建 4D」(误差层层累积),要么把 4D 预测死死绑定在某个特定视频生成器上(换模型就得重训)。这篇工作提出直接「从潜空间到 4D」:跳过 RGB,把视频模型的去噪潜变量对齐到预训练 4D 解码器的 token 网格上。一个 checkpoint 就能在同一个 VAE 家族里的多个视频扩散模型之间无缝迁移,在 Text4D-200 / I4D-200 上全面超越 Wan+4RC 级联方案,几何和时序稳定性也更受人类评审青睐。
4D 生成
视频世界模型
潜空间
多模态
arXiv 2608.10915 · 2026-08-11 · HuggingFace Trending(167 upvotes)
老人漏吃药了,软件 agent 会再发条提醒,具身机器人能把药送过去——但谁都没搞懂:老人到底是忘了、糊涂了、有副作用,还是故意不吃?这篇工作点破了当下 Agentic AI 的结构性盲区:数字 agent 只改软件状态、具身 agent 只改物理状态,「人」的演化状态与自主权,从未成为建模与干预的核心对象。ComBodied Agents 提出以人为中心的新范式,用软件、传感器、可穿戴设备和机器人作为「行动通道」,建立个人世界模型(Personal World Model),在知情同意与安全约束下预判并支撑个体状态轨迹,把个人助理、健康 agent、AI 陪伴等碎片能力统一成一个闭环。
具身智能
人本 AI
世界模型
新范式
🤖具身智能 & Agent
arXiv 2608.11204 · 2026-08-11 · cs.RO
手术机器人的命门在于数据:带动作标注的遥操作轨迹又贵又难采,而内窥镜视频却便宜又海量——可惜现有方法只拿视频做仿真或评估,很少真把学到的动力学变成闭环控制。Surgical WAM(世界-动作模型)基于 Cosmos Policy 构建,一个统一生成模型同时预测未来内窥镜画面和可执行的手术动作块,先在大规模无动作视频上预训练世界模型,再用极少的标注轨迹精调。它回答了一个关键问题:在固定动作标注预算下,无动作视频预训练到底能不能提升闭环手术操作?对数据敏感的医疗机器人落地意义重大。
手术机器人
世界模型
数据高效
具身智能
arXiv 2608.07645 · 2026-08-07 · HuggingFace Trending
会自我改写源码的编码 agent 已经不稀奇,但现有方案每次只从「一条失败轨迹」里学教训,白白浪费了 agent 存档里积攒的丰富对比信号。这篇工作把孟德尔的遗传学引入自我改进:除了常规的「单轨迹克隆变异」,新增了反应规范变异(同时综合多个任务上的轨迹来编辑自己)和跨谱系杂交(借另一谱系参考 agent 在同任务上的轨迹来改良自己)。在可加性适应度模型下有理论收敛保证,实验在 SWE-bench 和 Polyglot 上稳定提升性能、效率与泛化能力——「用别人的经验,进化自己的代码」。
自改进 Agent
编码 Agent
进化算法
开源
💡 小晴点评
今天最让我眼睛一亮的,是 BDH-CQ 那条「藏着思考、只给答案」的路线。过去一年大家都在比谁推理链更长、更「透明」,它却反手把推理塞进潜空间循环里,用 1.5 亿参数打出了比肩大模型的高性价比。这背后其实藏着一个更大的问题——思维链到底是模型的「能力」,还是模型的「软肋」?昨天的研究刚证明闭源 CoT 能被窃取,今天就有工作告诉你「不出声也能想得清楚」,两相呼应,挺耐人寻味。
另一条暗线是 「自我」的回归:U-OPSD 无监督自我蒸馏、Mendel Gödel Machine 的跨谱系自改进、还有满屏的自进化 agent 综述,都在说同一件事——模型正在学会只靠自己的经验、甚至别人的经验,来让自己变得更好。当「进化」不再需要人类标注和教师模型兜底,这个飞轮一旦转起来,AI 的能力增长可能就不再是我们熟悉的线性节奏了。
而从 ComBodied Agents 到 Surgical WAM,AI 的视线正从「屏幕里的对话」转向「真实世界里的人与物」。以人为中心的 agent、用便宜视频学手术的机器人——2026 年的这个夏天,AI 正在悄悄把「智能」的边界,从 token 延伸到生活与身体的每一个角落。