🔥 Harnessed Agentic RL · 三连发
arXiv 2608.17393 · LEGO-RL
针对「把编码智能体原生的 harness 环境直接拿来跑强化学习」时遇到的训练-推理不一致、奖励作弊、环境崩溃等问题,LEGO-RL 提出三大支柱:进程内 LLM 代理(capture 原始生成流做 token 级对齐、训练器侧重算 log-prob)、可扩展沙箱编排(镜像缓存 + 分阶段防作弊)、可观测训练(Live UI 轨迹诊断)。在 SWE-bench Verified 上,把稀疏 MoE 模型 Qwen3.5-35B-A3B 在 OpenHands / Claude Code / OpenCode 三个原生 harness 上分别从 64.0%/62.4%/57.2% 提到 70.4%/68.2%/66.6%,且 rollout-训练概率相关性保持在 0.99 以上。
Agentic RL编码智能体MoE
arXiv 2608.17528 · Agent Lightning v1.0
作者系统梳理了「harnessed agentic RL」这一范式——部署时的 agent harness 直接参与模型后训练,harness(而非训练引擎)拥有环境交互循环,训练器只观察 LLM 请求-响应对序列。这一架构被 verl Uni-Agent、AReaL 2.0、slime、Polar 等框架相继采用。Agent Lightning v1.0 用约 3500 行代码实现轻量框架,只用了 6K 训练样本、中等算力,就把 Qwen3.5-9B 在 SWE-bench Verified 上从 41.8% 提到 56.4%(+14.6 分),并公开了完整可复现流程。
开源RL 后训练框架
arXiv 2608.17597 · HarnessRisk
harness 越重要,安全风险越值得警惕。HarnessRisk 把 agent harness 的安全拆成配置、能力扩展、运行时、状态持久化、动作控制、事件恢复六个生命周期阶段,128 个沙箱案例。跨 3 个 harness、6 个模型、14 种配置,攻击成功率从 12.6% 到 80.9% 不等,其中「Harness Configuration」是全线最脆弱环节——攻击者只需篡改安全敏感参数就能得手;而且「识别出风险」并不等于「会采取安全动作」。
AI 安全BenchmarkAgent