问题背景:异步RL的稳定性与off-policy困境
LLM开发正从监督预训练转向后训练强化学习。近期工作表明,扩展RL计算量与测试时计算量是提升模型智能的高效路径。然而,大多数LLM RL流水线仍采用同步批交错模式:策略生成一批rollout,优化仅在整批收集完成后才开始。
对于智能体与编码任务,rollout长度高度可变——短轨迹快速完成,长轨迹成为"掉队者"(straggler),导致GPU集群大部分空转等待最慢的rollout。异步RL通过"rollout到达即消费"缓解这一不均衡生成开销,提升利用率与墙钟效率。
但异步引入两个核心挑战:
1.1 策略滞后与训练不稳定
在异步RL中,每条轨迹可能由多个版本的旧rollout模型生成,导致更不可预测、更严重的off-policy,从而损害训练稳定性。此前工作(AReaL、Asynchronous RLHF)主要关注效率优化而非有效性。
1.2 GRPO组采样与异步的结构性不匹配
GRPO对每个提示采样一组响应,用组级平均进行优势估计。组采样引入延迟驱动的off-policy:组必须等待最慢样本完成后才能送入训练。此外,组采样与在线或复杂智能体设置不兼容——在这些设置中,环境通常每提示仅提供单条轨迹反馈。
SAO的核心洞察是:用单rollout替代组采样,配合更激进但更稳定的token级裁剪,可以在保持异步效率的同时解决off-policy与稳定性问题。关键在于让价值模型足够好,以补偿单rollout固有的高方差。
SAO核心设计:三大组件概览
SAO由三个紧密配合的组件构成,分别解决异步RL中的稳定性、off-policy与多轮轨迹信用分配问题:
- 直接双侧token级重要性采样(DIS)——直接复用rollout引擎的log-prob作为行为代理,丢弃不精确的π_old;对信任域 [1−ε_l, 1+ε_h] 外的token完全掩码而非仅裁剪
- 单rollout采样 + 价值模型增强——每提示仅一条rollout,立即送入训练;通过更快critic更新(K=2)、冻结注意力训练与价值预训练扩容来降低方差
- 跳过观测token级GAE——跨动作-动作边界计算优势,跳过环境反馈token,避免在模型不生成的观测token上传播噪声
三者形成闭环:DIS稳定异步更新,单rollout消除组等待延迟,价值模型补偿单rollout方差,跳过观测GAE为多轮智能体轨迹提供干净信用分配。
组件一:直接双侧token级重要性采样(DIS)
异步RL的首要挑战是rollout模型与训练模型之间的"策略滞后"。在解耦PPO中,重要性采样通过维护三个模型来缓解off-policy偏差:当前策略π_θ、旧策略π_{θ_old}和rollout策略π_{rollout}。然而,rollout引擎在单条轨迹生成期间可能经历多次更新,使得精确追踪π_{θ_old}在计算上不可行——需要维护大量历史检查点。
3.1 直接使用rollout log-prob
SAO的简化策略:直接用π_{rollout}作为行为代理,用π_θ做重要性采样,即 r_t(θ) = π_θ / π_{rollout},丢弃不精确的π_{θ_old}。这消除了单独旧策略推理的计算开销,直接利用rollout阶段生成的log-prob。
3.2 双侧校准token级掩码
标准PPO裁剪仅裁剪选定的off-policy token(A>0且r>1+ε_h,或A<0且r<1−ε_l)。SAO采用更激进的策略:将信任域限制在 [1−ε_l, 1+ε_h] 区间内,区间外的token完全从梯度计算中掩码,防止极端策略发散导致的不稳定。
f(x; ε_l, ε_h) = x, 若 1−ε_l < x < 1+ε_h;否则 0
校准函数使优化目标变为:L(θ) = Ê_t [ f(r_t(θ), ε_l, ε_h) · Â_t · log π_θ(a_t|s_t) ]。概率比直接从rollout日志计算:r_t(θ) = exp(log π_θ(a_t|s_t) − log π_{rollout}(a_t|s_t))。
这一设计与IcePop机制相似但更简单——进一步移除了π_{θ_old},仍实现稳定训练。实验中数学推理使用 ε_low=0.3、ε_high=5.0,编码使用 ε_low=0.8、ε_high=3.0。非对称裁剪(ε_high >> ε_low)允许正向优势token更大更新空间,同时严格抑制负向off-policy。
组件二:单rollout采样与价值模型训练
单rollout优化天然存在高方差(类似REINFORCE)。降低方差需要足够好的价值模型。SAO从三个维度增强价值模型:
4.1 比策略更快的价值更新
单rollout RL不稳定的主要来源是策略与价值函数的相互依赖。若价值模型V_φ不准确,优势估计Â_t变噪声,导致破坏性策略更新。SAO解耦优化频率:每对策略π_θ执行一次梯度更新,对价值网络V_φ执行K次更新(K=2)。这使价值估计在用于优势计算前更快适应当前策略,从而降低方差。
4.2 冻结注意力稳定价值训练
试点实验发现价值模型训练的不稳定性——价值模型梯度范数显著大于策略模型。进一步分解表明,不稳定性主要来自全注意力层,而MoE层保持相对稳定。基于此观察,SAO采用"冻结注意力"策略:RL训练期间冻结V_φ的注意力模块参数,仅优化MoE投影。假设预训练注意力权重已具备足够的语义能力来关注相关token,将优化限制在MoE层有效正则化价值模型。
4.3 价值预训练扩容
价值估计的"冷启动"问题是主要瓶颈。通过显著增加价值预训练语料规模,提供鲁棒的初始化点,从训练早期就促进单rollout与TTUR机制的有效性。
组件三:跳过观测token级GAE
智能体任务对token级价值估计提出独特挑战。轨迹结构为 T = [a_0, o_0, a_1, o_1, ...],其中a_i是模型动作,o_i是环境反馈。标准GAE尝试计算相邻token间的价值差,但从动作末尾a_{i,end}到观测开头o_{i,start}的转换对模型而言是不连续的——模型不生成o_i。在这个边界上计算优势会引入噪声,因为价值模型V(o_{i,start})试图预测外部环境状态的价值。
5.1 跳过观测的Bellman目标
SAO显式修改Bellman目标,绕过环境反馈token,将当前动作的价值直接链接到下一个动作的价值:
Â(a_{i,N}) = δ + γλ · Â(a_{i+1,0})
其中 δ = r_t + γV(a_{i+1,0}) − V(a_{i,N})
这一公式将优势估计限制为仅依赖模型输出,过滤环境反馈的随机性。论文还对比了步级价值函数与GAE的替代方案,发现步级价值导致次优性能——token级训练为critic和策略提供更细粒度的监督信号,对准确捕捉复杂推理轨迹中的逻辑转换至关重要。
实验结果:五大基准全面领先
6.1 实验设置
数学推理使用Qwen3-30B-A3B-Thinking-2507,先在GPT-OSS-120B产生的工具集成推理(TIR)数据上微调3个epoch,用微调模型初始化策略与价值模型。RL配置:batch 128、group size 1、max-length 128k token、策略学习率1×10⁻⁶、价值学习率5×10⁻⁶、K=2。GRPO变体每批16提示×8 rollout = 同样128 batch。SWE-Bench Verified使用OpenHands脚手架,最多300交互轮、128k上下文。评估使用top-p=1.0、temperature=1.0,AIME2025/HMMT/IMOAnswerBench报告16次运行均值,BeyondAIME报告4次运行均值。
6.2 数学推理基准
| 模型 | AIME2025 | BeyondAIME | HMMT Nov 2025 | IMOAnswerBench |
|---|---|---|---|---|
| Claude-Sonnet-4.5 | 87.0 | 62.0 | 81.7 | 65.8 |
| GPT-5 High | 94.6 | 74.0 | 89.2 | 76.0 |
| GLM-4.7 | 95.7 | — | 93.5 | 82.0 |
| Qwen3-30B SFT (w/ python) | 80.4 | 53.3 | 75.2 | 53.3 |
| GRPO (w/ python) | 84.2 | 54.8 | 76.0 | 55.8 |
| SAO (ours) | 97.3 | 74.8 | 88.3 | 74.0 |
| SAO (DIS only) | 94.2 | 71.5 | 86.7 | 71.3 |
| GRPO (+ DIS) | 93.5 | 70.8 | 84.0 | 70.0 |
SAO在四个数学基准上全面领先:AIME2025达97.3%(超越GPT-5 High的94.6%),BeyondAIME达74.8%(与GPT-5 High持平),HMMT达88.3%,IMOAnswerBench达74.0%。值得注意的是,仅使用DIS(不含单rollout)的SAO变体已达94.2%,GRPO+DIS达93.5%,说明DIS本身是强大的稳定化组件;单rollout的增益在约400步后显现——SAO与GRPO+DIS在初始阶段性能相当,之后出现明显分化。
6.3 编码基准
| 模型 | SWE-Bench Verified (%) |
|---|---|
| Qwen3-30B-A3B | 23.0 |
| + GRPO (w/ DIS) | 27.0 |
| + SAO (ours) | 29.8 |
SWE-Bench Verified上SAO达29.8%,比GRPO+DIS高2.8个百分点,比基线高6.8个百分点。标准GRPO在约160步训练后性能崩溃,所报告分数为崩溃前最终有效性能。
消融研究与训练动态
7.1 价值模型消融
| 变体 | AIME2025 | BeyondAIME |
|---|---|---|
| SAO | 97.3 | 74.8 |
| SAO w/o Faster value (K=1) | 95.0 | 69.8 |
| SAO w/o Frozen attention (全参数) | 90.6 | 74.5 |
| Vanilla VAPO (w/o DIS) | 91.3 | 69.0 |
| Running mean baseline | 79.8 | 55.3 |
所有变体均出现性能下降,验证每个设计选择的必要性。关键发现:
- 更快价值更新:K=1时AIME2025从97.3降至95.0,BeyondAIME从74.8降至69.8——单次更新不足以让critic准确追踪快速策略偏移
- 冻结注意力:全参数价值训练AIME2025暴跌至90.6(−6.7),说明冻结注意力有效正则化critic优化
- Vanilla VAPO:无DIS时训练快速崩溃(约90步),与vanilla GRPO类似
- Running mean:79.8/55.3,远低于SAO,证明训练良好的价值模型不可替代
7.2 训练动态分析
- 解释方差(EV):SAO在约400步后显示显著更高的EV,表明价值更快收敛、与策略分布更好对齐
- Critic梯度范数:全参数训练梯度范数显著更大且不稳定;冻结注意力保持更低、更平滑的梯度
- Token裁剪率:VAPO维持近零裁剪率但无法有效门控发散的off-policy更新(约90步崩溃);SAO的DIS积极裁剪发散token,维持稳定
7.3 动作粒度消融
对比token级与步级价值训练(400步):步级平均85.8/60.5,步级末token87.3/62.8,token级89.8/66.8。token级一致最优,因为提供更细粒度监督信号,对捕捉复杂推理轨迹中的逻辑转换至关重要。
模拟在线学习:非平稳环境的快速适应
真实在线学习环境中,反馈通常限制为每提示单条轨迹——这与GRPO等组优化策略结构性不兼容。SAO利用价值critic提供优势估计,允许从单条轨迹进行有效策略更新。
8.1 任务设计
设计模拟在线写作任务评估SAO在非平稳环境中的适应能力。反馈信号设计为用户偏好的语言风格,奖励标准依次调整为偏爱三种风格原型:cute(可爱)、chuunibyou(中二病)、classical(古典)。使用GLM-4.7作为LLM裁判评估响应质量与风格 adherence,最终奖励 r = r_quality × r_style(均为二值)。
8.2 结果
SAO在每次奖励偏好切换后展示快速策略重对齐——迅速抑制此前主导风格,基于环境反馈重新对齐到新目标。对比Running Mean基线(128最近奖励滑动窗口):Running Mean因历史窗口惯性表现出显著适应滞后,窗口暂时被前一分布的奖励偏置;SAO的价值critic动态追踪奖励偏移,促进快速恢复并保持更高收敛水平。这证实SAO的状态依赖基线提供了非平稳环境中有效对齐所需的精度。
AI4Science启示:单rollout范式的科学应用
SAO虽以数学推理与编码为实验载体,但其核心设计对AI4Science智能体RL具有直接启示:
9.1 单rollout契合真实科学环境的反馈约束
论文明确指出:组采样"与在线或复杂智能体设置不兼容——环境通常每提示仅提供单条轨迹反馈"。这恰好描述了科学实验的现实:湿实验每条件仅一条结果、临床试验每患者仅一条轨迹、在线实验设计每配置仅一次观测。SAO证明了单rollout+价值模型可以在这些约束下实现有效策略更新,为科学agent的在线RL提供了可行路径。
9.2 跳过观测GAE为工具调用密集的科学agent提供干净信用分配
科学agent的典型轨迹结构 T = [a_0, o_0, a_1, o_1, ...] 中,o_i可能是BLAST结果、对接分数、实验读数等外部反馈。标准GAE在这些边界上计算优势会引入噪声——价值模型试图预测外部环境状态的价值。SAO的跳过观测GAE将优势估计限制为仅依赖模型输出,过滤工具调用返回的随机性,为多步科学推理(如"检索→分析→假设→验证"循环)提供干净的信用分配。
9.3 在线学习适应→自适应实验设计与演化环境
SAO的模拟在线学习实验(风格偏好切换)直接映射到科学场景:实验条件随批次演化、筛选标准随先验更新、目标表型随传代变化。SAO的价值critic动态追踪奖励偏移的能力,意味着科学agent可以在非平稳环境中快速重对齐——例如当先验数据更新导致"好结果"的定义改变时,agent无需从头训练即可适应。
9.4 冻结注意力→大规模科学模型的高效RL
SAO发现价值模型不稳定性主要来自注意力层而非MoE层,冻结注意力仅优化MoE投影即可稳定训练。对于在科学语料上预训练的大模型(如蛋白语言模型、分子编码器),这一发现意味着RL后训练可以保留预训练语义能力的同时仅微调专家路由,大幅降低训练成本与不稳定性。
9.5 GLM-5.2开源部署→科学社区可用的智能体RL基座
SAO已成功部署于开源GLM-5.2(750B-A40B)的智能体RL流水线。GLM-5.2作为开源模型,科学社区可以直接在其基础上构建领域agent——从文献挖掘、实验设计到数据分析——并利用SAO的异步RL流水线进行后训练。这降低了科学agent RL的门槛:不需要从零构建RL基础设施,只需准备领域任务与奖励函数。
9.6 DIS的实践价值→降低RL基础设施复杂度
DIS直接复用rollout引擎的log-prob、丢弃π_old,消除了维护历史检查点集合的需求。对于资源有限的科学实验室,这意味着异步RL可以在更简单的基础设施上运行——无需复杂的检查点管理系统,只需rollout引擎记录token级log-prob即可。非对称裁剪(ε_high >> ε_low)的设计也提供了实践指导:允许正向探索但严格抑制有害更新。
关键数据速览与总结
论文信息:
· Hou, Z., Li, Y., Tang, J. & Dong, Y. "Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning." arXiv:2607.07508v1, 8 Jul 2026.
· 单位:Tsinghua University;工作在Z.AI实习期间完成;*Equal Contribution: Hou & Li
· 部署:SAO成功部署于开源GLM-5.2(750B-A40B)智能体RL流水线
核心数据速览:
· 骨干模型:Qwen3-30B-A3B-Thinking-2507(实验);GLM-5.2 750B-A40B(部署)
· RL配置:batch 128、group size 1、max-length 128k、lr 1×10⁻⁶(策略)/5×10⁻⁶(价值)
· 裁剪参数:数学 ε_low=0.3/ε_high=5.0;编码 ε_low=0.8/ε_high=3.0
· 价值更新:K=2(每策略更新2次critic更新)、冻结注意力、10步warmup
· AIME2025:SAO 97.3% vs GRPO 84.2% vs SFT 80.4%(+13.1 over GRPO)
· BeyondAIME:SAO 74.8% vs GRPO 54.8%(+20.0)
· HMMT Nov 2025:SAO 88.3% vs GRPO 76.0%(+12.3)
· IMOAnswerBench:SAO 74.0% vs GRPO 55.8%(+18.2)
· SWE-Bench Verified:SAO 29.8% vs GRPO+DIS 27.0% vs 基线 23.0%(+2.8 over GRPO+DIS)
· 训练稳定性:SAO千步稳定;vanilla GRPO约160步崩溃;vanilla VAPO约90步崩溃
· 性能分化点:SAO与GRPO+DIS在约400步后出现明显分化
· 在线学习:SAO快速适应风格切换;Running Mean因窗口惯性显著滞后
三大核心组件:
· 1. DIS(直接双侧token级重要性采样)——复用rollout log-prob、丢弃π_old、信任域外完全掩码
· 2. 单rollout + 价值模型增强——K=2更快critic、冻结注意力、价值预训练扩容
· 3. 跳过观测token级 GAE——跨动作-动作边界、过滤环境反馈噪声
核心洞察:
· 异步RL的稳定性问题可通过更激进的token级裁剪解决,而非更复杂的策略追踪
· 组采样是异步RL的结构性瓶颈——单rollout+好价值模型是更优解
· 价值模型不稳定性主要来自注意力层——冻结注意力仅优化MoE即可正则化
· token级价值训练优于步级——更细粒度监督对复杂推理至关重要
· 单rollout天然契合在线/真实环境(每提示单条反馈)
AI4Science启示:
· 单rollout契合湿实验/临床试验/在线实验设计的单轨迹反馈约束
· 跳过观测GAE为工具调用密集的科学agent提供干净信用分配
· 在线学习适应→自适应实验设计与演化环境
· 冻结注意力→大规模科学模型的高效RL后训练
· GLM-5.2开源→科学社区可用的智能体RL基座
· DIS降低RL基础设施复杂度→资源有限实验室的可行路径
诚实声明:
· 本报告所有数值均来自论文原文(Table 1-5, Figure 3-5),已逐项核对
· 论文诚实声明局限:实验聚焦Qwen3-30B-A3B骨干的大规模智能体推理/编码/模拟写作,结论可能不直接迁移到更小模型、非智能体RLHF或密集奖励短rollout环境
· SAO依赖训练好的价值模型与rollout log-prob,部署需要可靠保存异步生成期间token级行为概率的基础设施
· 在线学习研究使用受控模拟偏好切换;真实面向用户的在线适应需要更强的安全防护、监控与隐私审查
· AI4Science启示部分为基于论文设计的合理推论,尚未在真实科学环境中验证