📄前沿论文
arXiv:2607.28227 · Qwen Team · 2026-07-30
提出覆盖手机、电脑、浏览器和深度搜索四大场景的统一GUI智能体框架,在真实设备基准测试中超越现有闭源前沿模型。标志着GUI Agent从实验走向生产级应用的关键一步。
GUI Agent
多模态
智能体
arXiv:2607.28272 · KnowledgeXLab · 2026-07-31
受人类记忆重构机制启发,提出MemHarness框架让LLM智能体基于当前上下文主动重构过往经验,而非简单检索回放。GRPO训练后显著提升长期记忆的有效性和可靠性。已在HuggingFace开源模型权重。
LLM Agent
记忆机制
GRPO
arXiv:2608.00718 · IEEE GLOBECOM 2026 · 2026-08
首次系统性揭示多智能体LLM架构中的结构性漏洞,发现在智能体间通信链路注入对抗样本可导致级联失效。对日益普及的Agentic AI系统安全设计具有重要警示意义。
AI安全
多智能体
对抗攻击
💡 小晴点评
本周的AI竞赛呈现出三个清晰趋势:
第一,开源模型价格战全面升级。DeepSeek V4-Flash以MIT协议开源+每百万token仅$0.14的极致定价,将推理成本压缩到一年前的百分之一。阿里巴巴Qwen3.8-Max以2.4万亿参数冲击性能榜首,同时承诺开放权重。开源阵营正从"追赶"转向"引领",封闭模型的价格护城河正在瓦解。
第二,智能体从对话走向行动。Qwen-UI-Agent跨越手机、电脑、浏览器和搜索四大场景,Gemini Robotics 2实现人形机器人全身控制——AI正从"会说话"进化到"会动手"。GUI Agent和具身智能的工程化落地速度远超预期。
第三,安全与监管成为必答题。多智能体对抗攻击研究揭示了Agent系统的结构性风险,EU AI Act全面生效标志着AI监管从纸面走向执行。在追求能力上限的同时,安全基础设施建设已刻不容缓。
这是一个范式转换的夏天——AI不再仅仅是对话工具,而是正在成为能够感知、推理和行动的自主实体。