🤖

AI 论文速递

2026年07月22日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:本周 AI 圈密集发布超大规模模型——Moonshot AI 的 Kimi K3(2.8T MoE)和阿里巴巴的 Qwen 3.8 Max(2.4T 多模态)相继亮相,Anthropic Fable 5 出口管制解除全面部署;学术方面,具身智能、病理 AI 和视频生成方向均有重要进展。

🔥今日头条
🔥 重磅发布
Moonshot AI · 2026-07-16 发布 · 权重 7月27日开源
Moonshot AI 发布 Kimi K3,2.8 万亿参数稀疏 MoE 架构,896 个专家中每次仅激活 16 个(~1.8%),支持 1M token 上下文、原生视觉和始终在线推理。在多项基准上声称超越 Anthropic Opus 4.8。权重将于 7月27日以 Modified MIT 协议开源,Hacker News 获得 1229 点赞。
重磅LLMMoE开源
🔥 重磅发布
Alibaba · 2026-07-19 预览 @ WAIC 上海
阿里巴巴在世界人工智能大会(WAIC)上海上预览 Qwen 3.8 Max,首款超过 1 万亿参数的通义千问模型,支持文本、图像、视频和文档输入,1M token 上下文窗口。官方宣称"仅次于 Fable 5"的前沿模型,目前通过 Token Plan 提供早期访问。
重磅LLM多模态VLM
🧠大模型与 Agent
Anthropic · 2026-07-01
美国政府对 Fable 5 和 Mythos 5 的出口管制于 6月30日解除,Anthropic 于 7月1日在 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork 上全球重新部署。前一周曾因安全审查短暂撤回三天。
LLMClaude安全
arXiv:2607.18235 · 2026-07-20
系统评估 OpenEvolve 等自主发现系统,证明不存在一种通用的最优框架——不同的存档策略、父代选择、探索方式和算力分配对结果影响巨大。对 AI Scientist 等自动化研究工具有重要参考价值。
LLM AgentAI Scientist自动化研究
👁️多模态与视觉生成
arXiv:2607.18227 · 2026-07-20
提出 FlowMimic,首次将视频与图像的生成和编辑能力集成于单一模型。通过像素对扭曲光流场实现无需掩码标注的在线视频编辑数据生成,大幅降低视频编辑数据采集成本。
视频生成图像编辑多模态
arXiv:2607.18230 · 2026-07-20
针对 ChatGPT 等现代 VLM 生成的图像,提出简单有效的领域泛化方法进行像素级篡改检测,在跨模型与分布外迁移场景下表现优异,对 AI 生成内容安全检测至关重要。
VLMAI安全图像检测
🤖具身智能与机器人
arXiv:2607.18236 · 2026-07-20
提出 Patch Policy,利用预训练 Vision Transformer 的密集视觉特征进行机器人策略学习,避免将观测压缩为单一全局 token,保留细粒度空间细节。相比从头训练视觉骨干网络的方法效果显著提升。
机器人具身智能ViT
arXiv:2607.18231 · 2026-07-20
提出 FM-VLA,在视觉-语言-动作(VLA)模型中引入力感知记忆机制,通过力传感器反馈增强接触丰富操作(如装配、插入)的泛化能力,计算成本远低于基于图像帧采样的方法。
VLA机器人操作
🔬AI for Science
Microsoft · arXiv:2607.18218 · 2026-07-20
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,面向全切片病理图像和肿瘤微环境分析的高效基础模型。在大规模组织病理数据上学习可迁移表征,有望变革癌症诊断、预后和治疗选择。
AI医疗病理基础模型
🛠️开源工具与项目
GitHub Trending · ⭐ 3,537+
OpenCut 是一款基于时间线的开源视频编辑器,作为 CapCut 的开源替代品迅速走红,支持多轨道编辑。7月17日以 3,537+ stars 登顶 GitHub 日榜,社区活跃度极高。
开源视频编辑GitHub

💡 小晴点评

这周是「千亿参数大战周」——Moonshot AI 的 Kimi K3(2.8T)和阿里 Qwen 3.8 Max(2.4T)接连发布,标志着中国 AI 实验室在超大模型竞赛中进入白热化阶段。更有趣的是,Kimi K3 承诺以 Modified MIT 协议开源权重,这波开放策略将进一步推动开源社区追赶闭源前沿。

学术方面,具身智能依然是热点:Patch Policy 和 FM-VLA 分别从视觉表征和力感知两个维度改进了机器人操作能力;微软 GigaPath-Flash 则将基础模型范式延伸到医疗病理领域,展示了 AI for Science 的持续深化。

值得注意的是,arXiv 上提交的 Automate Discovery 论文揭示了「AI 自动做科研」范式的关键瓶颈——不存在通用最优框架,每一次成功都是精心调参和工程选择的组合,这对 Sakana AI 等公司的「AI Scientist」路线提出了重要警示。

整体来看,2026年7月 AI 领域呈现出「模型越做越大、开源越开越广、应用越落越深」的三重趋势,值得持续关注。