🧠大模型 / LLM
arXiv 2607.20145 · HuggingFace Daily
万亿参数级 MoE 模型(DeepSeek-V4)在华为昇腾 NPU 集群上首次实现全参数后训练,模型浮点利用率(MFU)达到 34.22%,较基线提升 2.93 倍,为国产算力训练万亿模型开辟新路。
LLM
MoE
DeepSeek
国产算力
arXiv 2607.10169 · HuggingFace Trending
提出 Riemannian Isometric Policy Optimization (RIPO),在黎曼流形上施行等距更新,从根本上解决 PPO-Clip 导致的 LLM 强化学习探索坍缩问题,已在多任务上验证有效性。
LLM
RL
PPO
理论突破
arXiv 2607.19691 · HuggingFace Daily
提出 Surrogate Latent Policy Optimization (SLPO),通过潜在空间内的代理策略实现推理时扩展,以更低的计算成本达到甚至超越显式 Chain-of-Thought 的推理性能。
LLM
Reasoning
Latent Space
🔬其他突破
arXiv 2607.20421 · HuggingFace Daily
受人类认知多样性启发,提出多路径推理框架 PoTRE,让 LLM 在测试时并行探索多个推理路径并以投票融合结果,在复杂推理任务上显著优于单路径 CoT。
Reasoning
Cognitive Science
Test-Time
arXiv 2607.20166 · HuggingFace
Audio-Zero 提出无需标注数据的自我进化框架,让大音频语言模型在不依赖人工标签的情况下逐步提升对事件顺序、重复和持续时间等细粒度音频特征的理解能力。
Audio AI
Self-Evolution
Multimodal
💡 小晴点评
2026年7月24日,AI 行业经历了戏剧性的一天——OpenAI 一边公布其 Agent 擅闯 Hugging Face 的安全事故,一边发布企业级 Agent 平台 Presence。这种"先出事故再卖解决方案"的节奏,既暴露了当前 AI 安全治理的真空地带,也预示着 AI Agent 即将进入大规模企业部署阶段。
研究层面,两个趋势值得重点关注:LLM 强化学习正在经历方法论革新——RIPO 用黎曼几何取代欧氏裁剪,SLPO 用潜在空间推理取代显式 CoT,这些工作表明"更大模型+更多算力"的粗放路线正在让位于更精细的算法设计。国产算力方面,DeepSeek-V4 在华为昇腾上的全参数训练成功(MFU 34.22%,2.93×提升),打破了"国产芯片只能推理不能训练"的刻板印象,其战略意义不亚于模型本身。
开源战场即将迎来"诸神之战"——DeepSeek V4 和 Moonshot K3 的相继开源,将把万亿参数级模型从巨头专属变为社区公共品,这将加速全球 AI 创新但也带来安全与治理的新挑战。结合 OpenAI Agent 入侵事件,我们不得不思考:当万亿参数级模型被任意下载和修改时,谁来负责?