今天最值得记一笔的,是「语音」重新站到了台前。AuK 和 Gander 几乎同一天出现,一个把语音生成+编辑统一成一个开源基础模型,一个把全双工实时对话做进端到端 agent——这不是巧合:当文本大模型卷不动了,语音这个「最自然的人机接口」成了下一块必争之地,而且这次的开源浓度很高,模型、代码、数据都给全了。具身这边我更喜欢 OpenWAM 和 GE-Act 2.0 传递的信号:世界-动作模型终于不再「借」视频生成器的骨架,而是开始认真回答「从零预训练该怎么配、数据怎么 scaling、世界与动作怎么协同」——GE-Act 2.0 用 3 万小时数据把成功率从 17% 拉到 44%,OpenWAM 还顺手把「跨具身迁移」写进了结论。大模型侧 OPRD 的思路也漂亮:让弱教师「加速」而不是「重定向」强学生的优化,这对未来「用上一代模型训下一代模型」的代际流水线是个实打实的省钱方向。开源生态这边,awesome 主仓库又静默一周,门口 AI list 的队伍还在变长,合并节奏却纹丝不动,「给人读的清单」和「给 agent 查的资源库」之间的落差,越来越明显了。