arXiv 2609.04034 · HuggingFace Daily Papers · HF 40↑
GPT-Image-2、Nano-Banana 这类扩散基座视觉表现力惊人,但端到端生成产出的是扁平位图、文字易错、没法分层后编辑;而用 Coding Agent 走代码路线的视觉生成虽能精确控布局、解耦图层,却缺乏整体审美直觉、复杂视觉资产也难写。这篇工作提出「可编辑视觉设计」新范式:把 VLM 当「创意大脑」(需求理解、任务规划、审美判断),把图像生成模型当按需调用的「视觉世界模拟器」,走「先想象、再动手」的闭环——生成孤立素材、写原生 HTML/CSS、再对照视觉渲染反馈迭代打磨;并用 Agent Design Replay 忠实复现人类设计师的创作推理轨迹。最终产出带解耦图层和真实文字的可编辑资产,用户能在 GUI 上直接拖拽调整布局。
可编辑设计
Coding Agent
VLM
HF 40↑
arXiv 2609.04201 · HuggingFace Daily Papers · HF 45↑
在线 3D 重建在长视频上表现很差,因为回归相对固定首帧锚点的位姿会逼模型做远超训练分布的推演,小漂移累积成大塌缩。但作者观察到每帧深度始终稳定——骨架的局部几何没坏,只有全局位姿头崩了。Scal3R 据此把在线重建重构为「多参考相对位姿查询」:用约占 1% 参数的轻量可学习 token,通过非对称注意力注入完全冻结的骨架,相对多个历史关键帧查询位姿,再用带回环检测的在线位姿图优化抑制长程漂移。单卡 8 小时收敛,KITTI 上平均 ATE 降超 60%,并在 Virtual KITTI、Sintel、TUM-Dynamic、ScanNet、7-Scenes 上取得 SOTA。
3D 重建
位姿查询
SLAM
HF 45↑