问题背景:异步RL的稳定性与off-policy困境

LLM开发正从监督预训练转向后训练强化学习。近期工作表明,扩展RL计算量与测试时计算量是提升模型智能的高效路径。然而,大多数LLM RL流水线仍采用同步批交错模式:策略生成一批rollout,优化仅在整批收集完成后才开始。

对于智能体与编码任务,rollout长度高度可变——短轨迹快速完成,长轨迹成为"掉队者"(straggler),导致GPU集群大部分空转等待最慢的rollout。异步RL通过"rollout到达即消费"缓解这一不均衡生成开销,提升利用率与墙钟效率。

但异步引入两个核心挑战:

1.1 策略滞后与训练不稳定

在异步RL中,每条轨迹可能由多个版本的旧rollout模型生成,导致更不可预测、更严重的off-policy,从而损害训练稳定性。此前工作(AReaL、Asynchronous RLHF)主要关注效率优化而非有效性。

1.2 GRPO组采样与异步的结构性不匹配

GRPO对每个提示采样一组响应,用组级平均进行优势估计。组采样引入延迟驱动的off-policy:组必须等待最慢样本完成后才能送入训练。此外,组采样与在线或复杂智能体设置不兼容——在这些设置中,环境通常每提示仅提供单条轨迹反馈。

SAO的核心洞察是:用单rollout替代组采样,配合更激进但更稳定的token级裁剪,可以在保持异步效率的同时解决off-policy与稳定性问题。关键在于让价值模型足够好,以补偿单rollout固有的高方差。

🎯SAO核心设计:三大组件概览

SAO由三个紧密配合的组件构成,分别解决异步RL中的稳定性、off-policy与多轮轨迹信用分配问题:

  1. 直接双侧token级重要性采样(DIS)——直接复用rollout引擎的log-prob作为行为代理,丢弃不精确的π_old;对信任域 [1−ε_l, 1+ε_h] 外的token完全掩码而非仅裁剪
  2. 单rollout采样 + 价值模型增强——每提示仅一条rollout,立即送入训练;通过更快critic更新(K=2)、冻结注意力训练与价值预训练扩容来降低方差
  3. 跳过观测token级GAE——跨动作-动作边界计算优势,跳过环境反馈token,避免在模型不生成的观测token上传播噪声

三者形成闭环:DIS稳定异步更新,单rollout消除组等待延迟,价值模型补偿单rollout方差,跳过观测GAE为多轮智能体轨迹提供干净信用分配。

🛡️组件一:直接双侧token级重要性采样(DIS)

异步RL的首要挑战是rollout模型与训练模型之间的"策略滞后"。在解耦PPO中,重要性采样通过维护三个模型来缓解off-policy偏差:当前策略π_θ、旧策略π_{θ_old}和rollout策略π_{rollout}。然而,rollout引擎在单条轨迹生成期间可能经历多次更新,使得精确追踪π_{θ_old}在计算上不可行——需要维护大量历史检查点。

3.1 直接使用rollout log-prob

SAO的简化策略:直接用π_{rollout}作为行为代理,用π_θ做重要性采样,即 r_t(θ) = π_θ / π_{rollout},丢弃不精确的π_{θ_old}。这消除了单独旧策略推理的计算开销,直接利用rollout阶段生成的log-prob。

3.2 双侧校准token级掩码

标准PPO裁剪仅裁剪选定的off-policy token(A>0且r>1+ε_h,或A<0且r<1−ε_l)。SAO采用更激进的策略:将信任域限制在 [1−ε_l, 1+ε_h] 区间内,区间外的token完全从梯度计算中掩码,防止极端策略发散导致的不稳定。

f(x; ε_l, ε_h) = x, 若 1−ε_l < x < 1+ε_h;否则 0

校准函数使优化目标变为:L(θ) = Ê_t [ f(r_t(θ), ε_l, ε_h) · Â_t · log π_θ(a_t|s_t) ]。概率比直接从rollout日志计算:r_t(θ) = exp(log π_θ(a_t|s_t) − log π_{rollout}(a_t|s_t))。

这一设计与IcePop机制相似但更简单——进一步移除了π_{θ_old},仍实现稳定训练。实验中数学推理使用 ε_low=0.3、ε_high=5.0,编码使用 ε_low=0.8、ε_high=3.0。非对称裁剪(ε_high >> ε_low)允许正向优势token更大更新空间,同时严格抑制负向off-policy。

🎲组件二:单rollout采样与价值模型训练

单rollout优化天然存在高方差(类似REINFORCE)。降低方差需要足够好的价值模型。SAO从三个维度增强价值模型:

4.1 比策略更快的价值更新

单rollout RL不稳定的主要来源是策略与价值函数的相互依赖。若价值模型V_φ不准确,优势估计Â_t变噪声,导致破坏性策略更新。SAO解耦优化频率:每对策略π_θ执行一次梯度更新,对价值网络V_φ执行K次更新(K=2)。这使价值估计在用于优势计算前更快适应当前策略,从而降低方差。

4.2 冻结注意力稳定价值训练

试点实验发现价值模型训练的不稳定性——价值模型梯度范数显著大于策略模型。进一步分解表明,不稳定性主要来自全注意力层,而MoE层保持相对稳定。基于此观察,SAO采用"冻结注意力"策略:RL训练期间冻结V_φ的注意力模块参数,仅优化MoE投影。假设预训练注意力权重已具备足够的语义能力来关注相关token,将优化限制在MoE层有效正则化价值模型。

4.3 价值预训练扩容

价值估计的"冷启动"问题是主要瓶颈。通过显著增加价值预训练语料规模,提供鲁棒的初始化点,从训练早期就促进单rollout与TTUR机制的有效性。

🔗组件三:跳过观测token级GAE

智能体任务对token级价值估计提出独特挑战。轨迹结构为 T = [a_0, o_0, a_1, o_1, ...],其中a_i是模型动作,o_i是环境反馈。标准GAE尝试计算相邻token间的价值差,但从动作末尾a_{i,end}到观测开头o_{i,start}的转换对模型而言是不连续的——模型不生成o_i。在这个边界上计算优势会引入噪声,因为价值模型V(o_{i,start})试图预测外部环境状态的价值。

5.1 跳过观测的Bellman目标

SAO显式修改Bellman目标,绕过环境反馈token,将当前动作的价值直接链接到下一个动作的价值:

Â(a_{i,N}) = δ + γλ · Â(a_{i+1,0})
其中 δ = r_t + γV(a_{i+1,0}) − V(a_{i,N})

这一公式将优势估计限制为仅依赖模型输出,过滤环境反馈的随机性。论文还对比了步级价值函数与GAE的替代方案,发现步级价值导致次优性能——token级训练为critic和策略提供更细粒度的监督信号,对准确捕捉复杂推理轨迹中的逻辑转换至关重要。

📊实验结果:五大基准全面领先

6.1 实验设置

数学推理使用Qwen3-30B-A3B-Thinking-2507,先在GPT-OSS-120B产生的工具集成推理(TIR)数据上微调3个epoch,用微调模型初始化策略与价值模型。RL配置:batch 128、group size 1、max-length 128k token、策略学习率1×10⁻⁶、价值学习率5×10⁻⁶、K=2。GRPO变体每批16提示×8 rollout = 同样128 batch。SWE-Bench Verified使用OpenHands脚手架,最多300交互轮、128k上下文。评估使用top-p=1.0、temperature=1.0,AIME2025/HMMT/IMOAnswerBench报告16次运行均值,BeyondAIME报告4次运行均值。

6.2 数学推理基准

模型AIME2025BeyondAIMEHMMT Nov 2025IMOAnswerBench
Claude-Sonnet-4.587.062.081.765.8
GPT-5 High94.674.089.276.0
GLM-4.795.793.582.0
Qwen3-30B SFT (w/ python)80.453.375.253.3
GRPO (w/ python)84.254.876.055.8
SAO (ours)97.374.888.374.0
SAO (DIS only)94.271.586.771.3
GRPO (+ DIS)93.570.884.070.0

SAO在四个数学基准上全面领先:AIME2025达97.3%(超越GPT-5 High的94.6%),BeyondAIME达74.8%(与GPT-5 High持平),HMMT达88.3%,IMOAnswerBench达74.0%。值得注意的是,仅使用DIS(不含单rollout)的SAO变体已达94.2%,GRPO+DIS达93.5%,说明DIS本身是强大的稳定化组件;单rollout的增益在约400步后显现——SAO与GRPO+DIS在初始阶段性能相当,之后出现明显分化。

6.3 编码基准

模型SWE-Bench Verified (%)
Qwen3-30B-A3B23.0
+ GRPO (w/ DIS)27.0
+ SAO (ours)29.8

SWE-Bench Verified上SAO达29.8%,比GRPO+DIS高2.8个百分点,比基线高6.8个百分点。标准GRPO在约160步训练后性能崩溃,所报告分数为崩溃前最终有效性能。

🔬消融研究与训练动态

7.1 价值模型消融

变体AIME2025BeyondAIME
SAO97.374.8
SAO w/o Faster value (K=1)95.069.8
SAO w/o Frozen attention (全参数)90.674.5
Vanilla VAPO (w/o DIS)91.369.0
Running mean baseline79.855.3

所有变体均出现性能下降,验证每个设计选择的必要性。关键发现:

7.2 训练动态分析

7.3 动作粒度消融

对比token级与步级价值训练(400步):步级平均85.8/60.5,步级末token87.3/62.8,token级89.8/66.8。token级一致最优,因为提供更细粒度监督信号,对捕捉复杂推理轨迹中的逻辑转换至关重要。

🌐模拟在线学习:非平稳环境的快速适应

真实在线学习环境中,反馈通常限制为每提示单条轨迹——这与GRPO等组优化策略结构性不兼容。SAO利用价值critic提供优势估计,允许从单条轨迹进行有效策略更新。

8.1 任务设计

设计模拟在线写作任务评估SAO在非平稳环境中的适应能力。反馈信号设计为用户偏好的语言风格,奖励标准依次调整为偏爱三种风格原型:cute(可爱)、chuunibyou(中二病)、classical(古典)。使用GLM-4.7作为LLM裁判评估响应质量与风格 adherence,最终奖励 r = r_quality × r_style(均为二值)。

8.2 结果

SAO在每次奖励偏好切换后展示快速策略重对齐——迅速抑制此前主导风格,基于环境反馈重新对齐到新目标。对比Running Mean基线(128最近奖励滑动窗口):Running Mean因历史窗口惯性表现出显著适应滞后,窗口暂时被前一分布的奖励偏置;SAO的价值critic动态追踪奖励偏移,促进快速恢复并保持更高收敛水平。这证实SAO的状态依赖基线提供了非平稳环境中有效对齐所需的精度。

🧪AI4Science启示:单rollout范式的科学应用

SAO虽以数学推理与编码为实验载体,但其核心设计对AI4Science智能体RL具有直接启示:

9.1 单rollout契合真实科学环境的反馈约束

论文明确指出:组采样"与在线或复杂智能体设置不兼容——环境通常每提示仅提供单条轨迹反馈"。这恰好描述了科学实验的现实:湿实验每条件仅一条结果、临床试验每患者仅一条轨迹、在线实验设计每配置仅一次观测。SAO证明了单rollout+价值模型可以在这些约束下实现有效策略更新,为科学agent的在线RL提供了可行路径。

9.2 跳过观测GAE为工具调用密集的科学agent提供干净信用分配

科学agent的典型轨迹结构 T = [a_0, o_0, a_1, o_1, ...] 中,o_i可能是BLAST结果、对接分数、实验读数等外部反馈。标准GAE在这些边界上计算优势会引入噪声——价值模型试图预测外部环境状态的价值。SAO的跳过观测GAE将优势估计限制为仅依赖模型输出,过滤工具调用返回的随机性,为多步科学推理(如"检索→分析→假设→验证"循环)提供干净的信用分配。

9.3 在线学习适应→自适应实验设计与演化环境

SAO的模拟在线学习实验(风格偏好切换)直接映射到科学场景:实验条件随批次演化、筛选标准随先验更新、目标表型随传代变化。SAO的价值critic动态追踪奖励偏移的能力,意味着科学agent可以在非平稳环境中快速重对齐——例如当先验数据更新导致"好结果"的定义改变时,agent无需从头训练即可适应。

9.4 冻结注意力→大规模科学模型的高效RL

SAO发现价值模型不稳定性主要来自注意力层而非MoE层,冻结注意力仅优化MoE投影即可稳定训练。对于在科学语料上预训练的大模型(如蛋白语言模型、分子编码器),这一发现意味着RL后训练可以保留预训练语义能力的同时仅微调专家路由,大幅降低训练成本与不稳定性。

9.5 GLM-5.2开源部署→科学社区可用的智能体RL基座

SAO已成功部署于开源GLM-5.2(750B-A40B)的智能体RL流水线。GLM-5.2作为开源模型,科学社区可以直接在其基础上构建领域agent——从文献挖掘、实验设计到数据分析——并利用SAO的异步RL流水线进行后训练。这降低了科学agent RL的门槛:不需要从零构建RL基础设施,只需准备领域任务与奖励函数。

9.6 DIS的实践价值→降低RL基础设施复杂度

DIS直接复用rollout引擎的log-prob、丢弃π_old,消除了维护历史检查点集合的需求。对于资源有限的科学实验室,这意味着异步RL可以在更简单的基础设施上运行——无需复杂的检查点管理系统,只需rollout引擎记录token级log-prob即可。非对称裁剪(ε_high >> ε_low)的设计也提供了实践指导:允许正向探索但严格抑制有害更新。

📄关键数据速览与总结

论文信息:

· Hou, Z., Li, Y., Tang, J. & Dong, Y. "Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning." arXiv:2607.07508v1, 8 Jul 2026.

· 单位:Tsinghua University;工作在Z.AI实习期间完成;*Equal Contribution: Hou & Li

· 部署:SAO成功部署于开源GLM-5.2(750B-A40B)智能体RL流水线

核心数据速览:

· 骨干模型:Qwen3-30B-A3B-Thinking-2507(实验);GLM-5.2 750B-A40B(部署)

· RL配置:batch 128、group size 1、max-length 128k、lr 1×10⁻⁶(策略)/5×10⁻⁶(价值)

· 裁剪参数:数学 ε_low=0.3/ε_high=5.0;编码 ε_low=0.8/ε_high=3.0

· 价值更新:K=2(每策略更新2次critic更新)、冻结注意力、10步warmup

· AIME2025:SAO 97.3% vs GRPO 84.2% vs SFT 80.4%(+13.1 over GRPO)

· BeyondAIME:SAO 74.8% vs GRPO 54.8%(+20.0)

· HMMT Nov 2025:SAO 88.3% vs GRPO 76.0%(+12.3)

· IMOAnswerBench:SAO 74.0% vs GRPO 55.8%(+18.2)

· SWE-Bench Verified:SAO 29.8% vs GRPO+DIS 27.0% vs 基线 23.0%(+2.8 over GRPO+DIS)

· 训练稳定性:SAO千步稳定;vanilla GRPO约160步崩溃;vanilla VAPO约90步崩溃

· 性能分化点:SAO与GRPO+DIS在约400步后出现明显分化

· 在线学习:SAO快速适应风格切换;Running Mean因窗口惯性显著滞后

三大核心组件:

· 1. DIS(直接双侧token级重要性采样)——复用rollout log-prob、丢弃π_old、信任域外完全掩码

· 2. 单rollout + 价值模型增强——K=2更快critic、冻结注意力、价值预训练扩容

· 3. 跳过观测token级 GAE——跨动作-动作边界、过滤环境反馈噪声

核心洞察:

· 异步RL的稳定性问题可通过更激进的token级裁剪解决,而非更复杂的策略追踪

· 组采样是异步RL的结构性瓶颈——单rollout+好价值模型是更优解

· 价值模型不稳定性主要来自注意力层——冻结注意力仅优化MoE即可正则化

· token级价值训练优于步级——更细粒度监督对复杂推理至关重要

· 单rollout天然契合在线/真实环境(每提示单条反馈)

AI4Science启示:

· 单rollout契合湿实验/临床试验/在线实验设计的单轨迹反馈约束

· 跳过观测GAE为工具调用密集的科学agent提供干净信用分配

· 在线学习适应→自适应实验设计与演化环境

· 冻结注意力→大规模科学模型的高效RL后训练

· GLM-5.2开源→科学社区可用的智能体RL基座

· DIS降低RL基础设施复杂度→资源有限实验室的可行路径

诚实声明:

· 本报告所有数值均来自论文原文(Table 1-5, Figure 3-5),已逐项核对

· 论文诚实声明局限:实验聚焦Qwen3-30B-A3B骨干的大规模智能体推理/编码/模拟写作,结论可能不直接迁移到更小模型、非智能体RLHF或密集奖励短rollout环境

· SAO依赖训练好的价值模型与rollout log-prob,部署需要可靠保存异步生成期间token级行为概率的基础设施

· 在线学习研究使用受控模拟偏好切换;真实面向用户的在线适应需要更强的安全防护、监控与隐私审查

· AI4Science启示部分为基于论文设计的合理推论,尚未在真实科学环境中验证