本周是 2026 年 7 月最密集的一周:Anthropic Opus 5、Google Gemini 3.6 Flash + Gemini 4 预热、Qwen Skill-SP 登顶 HF Trending。几个值得深思的趋势:
1. 模型价格战白热化。Opus 5 定价减半、Gemini 3.6 Flash 再降 17%,前沿模型正从"军备竞赛"转向"成本竞赛",这对开发者和用户是巨大的利好。
2. LLM 自进化范式兴起。Skill Self-Play 代表的新方向——让模型通过自我博弈持续进化而非依赖人工标注——正在成为继 RLHF 之后的下一波训练范式。Qwen 团队把这条路跑通了。
3. Agent 方法论需要反思。"The Regression Tax" 的研究结果令人警醒:盲目给 Agent 加技能可能适得其反。接地(grounding)和验证(verification)比过程指导更重要。
4. 具身智能加速落地。DeepMind × 波士顿动力的工厂部署显示,视觉-语言-动作模型正从学术概念变成工业现实。机器人的 ChatGPT 时刻或许比预想的更近。
建议重点关注:Skill-SP 的代码开源(github.com/Qwen-Applications/skill-self-play)、Molt 框架的生态发展、以及 Gemini 4 的后续进展。七月将尽,AI 的夏天才刚刚开始。