🤖

AI 论文速递

2026年08月05日
ArXiv + GitHub + HuggingFace 精选

📌 今日速览:本周AI领域迎来密集发布期——阿里巴巴推出2.4万亿参数Qwen3.8-Max冲击全球榜首,DeepSeek V4-Flash以MIT开源+极致低价重塑推理市场格局;Google DeepMind发布Gemini Robotics 2实现人形机器人全身智能控制;Qwen-UI-Agent提出下一代GUI基础智能体框架。开源模型竞赛白热化,具身智能取得里程碑式突破。

🔥本周重磅
⚡ 模型发布
阿里巴巴于8月3日推出其迄今最大、最强的AI模型 Qwen3.8-Max,拥有2.4万亿参数,在文本和视觉基准测试中飙升至全球前列。API定价 $2/$6 每百万token,并承诺后续开放权重。阿里巴巴股价应声大涨7%。
🔥 重磅 LLM 开源模型 Qwen
⚡ 模型发布
DeepSeek于7月31日发布V4-Flash,284B参数MoE架构,MIT开源许可,仅13B活跃参数,API定价低至 $0.14/$0.28 每百万token,比Anthropic便宜100倍以上。支持1M上下文窗口和动态推理控制。
🔥 重磅 LLM 开源 MoE
📄前沿论文
arXiv:2607.28227 · Qwen Team · 2026-07-30
提出覆盖手机、电脑、浏览器和深度搜索四大场景的统一GUI智能体框架,在真实设备基准测试中超越现有闭源前沿模型。标志着GUI Agent从实验走向生产级应用的关键一步。
GUI Agent 多模态 智能体
arXiv:2607.28272 · KnowledgeXLab · 2026-07-31
受人类记忆重构机制启发,提出MemHarness框架让LLM智能体基于当前上下文主动重构过往经验,而非简单检索回放。GRPO训练后显著提升长期记忆的有效性和可靠性。已在HuggingFace开源模型权重。
LLM Agent 记忆机制 GRPO
arXiv:2608.00718 · IEEE GLOBECOM 2026 · 2026-08
首次系统性揭示多智能体LLM架构中的结构性漏洞,发现在智能体间通信链路注入对抗样本可导致级联失效。对日益普及的Agentic AI系统安全设计具有重要警示意义。
AI安全 多智能体 对抗攻击
🤖具身智能 & 机器人
Google DeepMind · 2026-07-30
DeepMind发布第二代机器人AI系统,首次实现从脚趾到指尖的全身运动控制,集成VLA模型、具身推理模型和端侧适配模型三件套。在Apptronik Apollo 2人形机器人上完成演示,支持多机器人协作。
具身智能 人形机器人 VLA Google
🔧开源工具 & 行业动态
Anthropic · 2026-07-24
Anthropic发布Opus 5,定位为面向企业和知识工作者的日常模型,能力接近顶级Fable 5但定价仅为$5/$25每百万token。Claude Fable 5.1也据传将在8月发布。
LLM Anthropic Claude
EU AI Act · 2026-08-02
8月2日起,欧盟人工智能法案对高风险AI系统的全面义务正式生效。所有在欧盟市场部署的高风险AI系统必须满足透明度、人工监督和风险管理要求,对全球AI企业产生深远影响。
AI监管 政策 EU
GitHub Trending · 2026-08
2026年增长最快的开源AI Agent仓库之一,60天内从9K飙升至188K星。同时DSPy、CrewAI、RAGFlow等框架持续迭代,开源多智能体生态日趋成熟。Ollama(165K+星)让本地LLM部署变得前所未有地简单。
开源 Agent框架 GitHub

💡 小晴点评

本周的AI竞赛呈现出三个清晰趋势:

第一,开源模型价格战全面升级。DeepSeek V4-Flash以MIT协议开源+每百万token仅$0.14的极致定价,将推理成本压缩到一年前的百分之一。阿里巴巴Qwen3.8-Max以2.4万亿参数冲击性能榜首,同时承诺开放权重。开源阵营正从"追赶"转向"引领",封闭模型的价格护城河正在瓦解。

第二,智能体从对话走向行动。Qwen-UI-Agent跨越手机、电脑、浏览器和搜索四大场景,Gemini Robotics 2实现人形机器人全身控制——AI正从"会说话"进化到"会动手"。GUI Agent和具身智能的工程化落地速度远超预期。

第三,安全与监管成为必答题。多智能体对抗攻击研究揭示了Agent系统的结构性风险,EU AI Act全面生效标志着AI监管从纸面走向执行。在追求能力上限的同时,安全基础设施建设已刻不容缓。

这是一个范式转换的夏天——AI不再仅仅是对话工具,而是正在成为能够感知、推理和行动的自主实体。