📄研究前沿
🔥 今日热点
HuggingFace Daily · ArXiv 2608.20335
现有相机控制的视频扩散模型,在生成 4DGS 重建所需的几十个新视角时会失去一致性。4DAnyone 把失败诊断为「有界注意力上下文」问题——当目标视角超出单次 DiT 前向的容量而被迫分组时,会暴露两个耦合瓶颈。作者据此提出重建级多视角一致视频生成 + 提升到 4D 高斯泼溅的完整管线,让单目视频也能稳定还原出可自由转动的 4D 人物。
多模态4D 重建视频生成3D/4D
ArXiv 2608.20338 · cs.CL
现有遗忘(unlearning)方法靠「遗忘/保留两个独立事实集」来评测,只测简单的直接事实回忆,无法验证「消除有害行为的同时保留良性知识」这一关键目标。ConceptGuard 主张遗忘必须发生在「概念」层面,提出首个面向概念级、上下文敏感遗忘的基准,把遗忘评测从「删掉一句事实」升级为「删掉一类概念」。
LLM 安全遗忘基准对齐
ArXiv 2608.20256 · cs.AI
推理模型通常按固定 token 预算生成,简单题浪费算力、难题又算不够。这项工作让模型在回复的第一个 token 就选择三种模式之一——NoThink(直接答)、Short(简短推理)、Long(扩展推理),并直接在 GRPO 中学习这个选择,无需额外的奖励模型,把「测试时算力分配」变成了模型自身的决策。
测试时计算推理自适应GRPO
ArXiv 2608.20336 · cs.CV
身份保持生成在场景里出现多个指定人物时最容易翻车——既要保持每个身份,又要把每个参考绑定到不同的人和位置。WithEveryone 把每个身份注入为「寻址 token」,先预测结构化身份-布局计划,再渲染成视觉条件,可稳定生成最多 10 个参考身份的群像,直击多人场景的身份串味难题。
图像生成身份保持多模态群像
ArXiv 2608.20314 · cs.AI
中训练(mid-training)正成为塑造大模型能力的关键阶段,但「通用工具使用」这条线还少有人系统研究。MidTool 提出一套开源语料构建管线,把大规模 web/PDF/代码数据与来自真实工具 API 的合成监督结合,专攻智能体的工具调用能力,补齐了中训练在 agent 方向的一块拼图。
LLM中训练Agent工具使用
ArXiv 2608.20251 · cs.RO
开门穿越是典型的长程移动操作任务,需要精准的把手交互与底盘-机械臂协同。该框架用 DoorTwin 从一段真实门的 RGB 视频重建实例对齐、可仿真的「门孪生」,再由仿真-in-the-loop 智能体把恢复出的铰接转化为参数化技能程序并迭代优化,实现单视频 real-to-sim-to-real 的可执行推门策略。
具身智能机器人移动操作仿真
💡 小晴点评
周末的 arXiv 静悄悄,但静水底下有暗流。我最想点两件事:一是「测试时计算」终于从『给多少算力』进化到『模型自己想想要多少算力』——Learning When to Think 让模型自己在 NoThink / Short / Long 三种模式里做选择,这比堆 token 预算更接近真正的「会思考」。二是多模态生成在「一致性」上集体攻坚——4DAnyone 治 4D 重建的视角漂移,WithEveryone 治多人合照的身份串味,背后其实是同一个难题:注意力窗口装不下时,模型就会顾此失彼。开源侧 Codex 的 Agent Plugins + MCP 组合拳,则是在告诉所有人:编码智能体正在从「单点工具」长成「可插拔平台」。周日也要充电,我们下期见~