🧾论文版本与来源

Ba 等人的 Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO 为 arXiv:2608.27351v2,2026 年 8 月 28 日更新。本文采用 arXiv 摘要、HTML 全文、PDF/TeX 源文件以及论文直接链接的代码仓库作为依据;AlphaXiv 仅作为访问入口。该工作仍是预印本,尚未经过同行评审。

🎯作者真正要解决的问题

ES 已被用于 LLM 推理后训练,表面优势很直接:不经反向传播,只需对参数扰动后的模型作前向评估,因此内存压力低、并行性高。但作者认为,这还没有回答它是不是一个独立且有用的后训练范式。与同样直接从可验证奖励学习的 GRPO 相比,ES 究竟改变了什么优化行为?显著的参数漂移是否意味着灾难性遗忘?规模扩大时要付出多大种群代价?

RQ1:覆盖,而非只看单次命中ES 能否提高 Pass@1,同时不牺牲多次采样下至少找到一次正确解的 Pass@K?
RQ2:位移,与功能不是同一件事ES 的全模型参数漂移远大于 GRPO;哪些变化真正在贡献任务性能,它们是否必然抹去已有能力?
RQ3:可行性条件奖励标准化、扰动尺度、种群大小和单/双点估计器如何共同决定 ES 的稳定性与可扩展性?

论文首先将评价重点放在推理覆盖:单样本答对与多次抽样仍能触达正确解是不同目标。随后讨论大幅参数位移的功能含义,并给出训练配置的实证分析。

⚙️共同目标、不同更新:GRPO 与 ES

二者共享同一个从提示、模型回复到验证器标量奖励的目标:最大化期望奖励 F(θ)。差异不在“是否使用奖励”,而在奖励通过什么路径作用于参数。GRPO 对同一提示从单一策略采一组回复,按组内相对奖励构造优势,再通过 token 级、带裁剪的策略梯度反向传播。ES 则在参数空间采样 N 个高斯方向,对每个扰动模型完成 rollout,将奖励标准化后加权回聚到一个全参数更新。

GRPO:rᵢ → 组内标准化优势 Âᵢ → token 级反向传播 → θ
ES:Rᵢ → 种群 z-score zᵢ → (1/N) Σ zᵢ εᵢ → θ⁺ = θ + α·dES

这一机制差异导出一个可检验预期:GRPO 的高概率 token 若持续获得正优势,策略熵可能下降、分布收缩。Pass@1 因而未必下降,但低概率正确推理路径再次被抽到的机会可能减少。ES 的参数扰动形成一组行为不同的局部策略,可能保留更宽的成功路径覆盖;这一点仍需理论条件与实验结果共同支持。

🧭RQ1:种群多样性如何变成更宽的推理覆盖

1. 作者的理论链不是“熵大所以好”

作者先由 Fisher 信息的局部展开说明:小参数扰动 σ·ε 会诱导提示条件策略的差异,其期望局部位移随 σ²·tr(Ix(θ)) 增长。接着,他们不以整个文本分布的差异为终点,而将种群策略投影到验证器相关的正确/错误成功变量,定义对应的 Jensen–Shannon 多样性。

论证链有三步:第一,扰动产生策略多样性;第二,在平均成功率相同的前提下,从成功率异质的多个策略各采一次,至少找到一个正确答案的概率不低于从单一策略重复采样;第三,奖励加权使成功率较高的种群成员得到更大权重。若这种加权后的成功率增益足以超过中心模型更新后的分布偏差,那么更新后的中心策略的 Pass@K 也会高于初始策略。最后这一步有明确充分条件,因此不是无条件定理。

论文真正的理论主张:验证器投影后的种群 JSD 对重复采样成功有帮助;在奖励对齐选择与中心更新误差满足特定裕量条件时,该优势可转移到 ES 更新后的单一中心策略。它不是“参数噪声必然提高所有任务多样性”的声明。

2. 经验检验:同看 Pass@1、Pass@16 与 Pass@32

Easy 设置使用 Qwen2.5-1.5B-Instruct、Llama-3.2-3B-Instruct、Qwen2.5-7B-Instruct,在 GSM8K 上后训练 2 epoch;Hard 设置使用 DeepSeek-R1-Distill-Qwen-1.5B,在 DeepScaleR 上训练 1 epoch。作者按其 FLOP 会计令 ES 的 32 个扰动方向与 GRPO 每提示 8 个回复可比。每题保留 32 个温度 0.6 的回答,报告 Pass@1、16、32。

图 2 显示,在 GSM8K 后训练的 Qwen2.5-1.5B 上,GRPO 的 held-out GPQA token 级熵明显下降,最终 Pass@16/32 低于基座;ES 的熵变化较小,两项指标均高于基座。表 2–3 将这一模式扩展到 Easy/Hard 设置:ES 在两个设置的平均 Pass@16 与 Pass@32 均高于 GRPO;GRPO 在 Easy 设置的 18 个比较中有 15 个在 Pass@16 和 Pass@32 低于相应基座。

Hard 设置数学平均(×100)Pass@1Pass@16Pass@32
Base47.773.577.4
GRPO52.974.778.0
ES49.975.078.9
ES → GRPO52.375.879.2
GRPO → ES51.676.278.2

原论文 Table 3;前两行和 ES 是直接比较,后两行是在相同总更新预算下各分两阶段的顺序组合。

3. 不是强迫二选一:顺序组合形成 Pareto 点

既然 GRPO 往往有更高的 Pass@1、ES 往往有更高的大 K 覆盖,作者把总更新预算一分为二,测试 ES→GRPO 与 GRPO→ES。图 3 显示两种顺序会在代表性任务上增加非支配点:Hard 数学平均中 ES→GRPO 的 Pass@32 最高,AIME25 在 K≥2 时则是 GRPO→ES 最强。其含义不是存在一个通用最佳顺序,而是顺序依赖任务,并可在单次准确性与抽样覆盖之间提供额外权衡。

🧩RQ2:大参数漂移为何不自动等于灾难性遗忘

1. 先承认现象,再分解它

作者先以相对全模型 L2 距离量化漂移。四个模型中,ES 终点距离是匹配 GRPO 的 40.7–44.1 倍。这一结果并未被回避;相反,作者提出全模型距离把大量坐标的变化混在一起,无法判断哪些变化真的承载了任务增益。一个高维随机游走在大量平坦或奖励弱相关方向上积累位移,可以很大,却不等于功能在全空间发生等量改变。

2. 阈值消融:从“参数稀疏”走向“功能集中”

将最终模型相对基座的每个参数变化记为 Δθi,作者依幅值阈值 τ 删除小更新:当 0 < |Δθi| ≤ τ 时把该变化归零,只保留较大更新。τ=1.5×10−3 时,77.6–93.0% 的非零更新落在被删除的小幅区间,亦即仅余 7.0–22.4% 较大更新。图 4 显示,逐步删除这些小更新后,目标任务 Pass@1 在较高稀疏度前总体保持稳定,明显下降只在很高稀疏度才出现。

这支持作者的表述:ES 虽触及全参数,但性能相关效应在较大幅值的少数坐标上集中。最大的 ES 更新主要落在 LayerNorm 权重与注意力投影;在相同模型上,GRPO 最大更新小得多,且其前 100 个变化集中在 token embedding 或语言模型 head。作者将其解释为两条更新路径不同的观察,不将这种位置差上升为已证实的因果机制。

3. held-out 评估改变了“漂移=遗忘”的判据

作者用跨任务 held-out 测试而非仅看权重距离。在三个 Easy 模型上,ES 的五个 held-out 任务平均 Pass@32 变化为正,GRPO 为负;Hard 设置的 GPQA、MBPP、CommonsenseQA、Countdown 平均中,ES 也有高于 GRPO 的 Pass@32(89.3 对 89.0),尽管 GRPO 的平均 Pass@1/16 略高(45.6/85.0 对 44.0/84.7)。

此处结论的准确强度:作者得到的是“大参数移动本身不足以推出灾难性遗忘”,并提出先前的遗忘观察可能混有训练集过拟合;不是“ES 不会遗忘”。论文自己强调,有些任务仍会下降,持续学习、多任务长训练与能力保留的一致性仍待检验。

🛠️RQ3:使 ES 有效且可扩展的设计条件

1. 种群内 z-score 不是装饰

ES 以种群内 z-score 将奖励变成相对信号,避免更新直接受绝对奖励尺度支配。在作者匹配的一点 ES 消融中,标准化在初始化后始终得到更高的平均训练奖励。扰动尺度 σ 则是探索半径与高斯平滑程度:过小会局部化、可能过拟合观测奖励;过大则跨越过宽区域而使训练不稳。论文给出选择原则,而非单一与任务无关的 σ。

2. 更大模型未必需要更大种群

作者用 Qwen2.5-{0.5,1.5,3}B-Instruct、N∈{8,16,32,64} 的 GSM8K 运行测试种群缩放。以 N=64 为参照、第 300 更新时:0.5B 只有 N=32 距参照不超过 0.01;1.5B 和 3B 则 N=16、32 都达到该阈值。N=16 对 N=64 的平滑奖励差依次为 0.0352、0.0051、0.0030。作者的解释是更大模型在预训练权重附近可能有更密的有效扰动方向;这是由这组缩放实验支持的趋势,而非已经证明的几何定律。

3. 双点 ZO 的经典直觉在 rollout 奖励下失效

正负对称扰动的两点 ES 在代数上可与两点零阶估计器一致。固定监督目标中,正负评估共享数据,差分可降低方差;但推理后训练会在两个扰动点重新生成自回归回答,早期 token 分岔会削弱这对评估所需的协方差。作者在匹配 GSM8K 运行中未发现双点 ES 对训练奖励或 held-out 性能的优势;附录 E 中,SST-2 有原始方差降低,重新生成的 GSM8K 奖励却不稳定。因此作者在弱耦合的推理 rollout 情形偏好更简单的一点估计。

📊实验设计、可比性与关键数字

下表汇总实验设置、指标边界和公开实现信息。

证据单元作者的设计它能支持什么,不能支持什么
计算匹配ES N=32 方向;GRPO G=8 回复;作者按前向/反向 FLOP 会计匹配。支持本文比较的计算口径;不等于两种系统在所有工程开销、实现成熟度上完全等价。
覆盖指标每题 32 个回答,温度 0.6;报告 Pass@1/16/32,另有 Maj@K。支持“重复采样可发现正确解”的比较;不直接度量回答校准、生成成本或开放式真实性。
保留能力Easy:五个 held-out 任务;Hard:四个非数学 held-out 任务;无 held-out 奖励参与训练。反驳“这组实验中的漂移必然导致广泛遗忘”;不覆盖长期连续适应。
实现透明度作者仓库提供配置、训练/评估脚本、测试和机器可读参考结果。提高可审计性;不替代第三方完整复现,也不改变预印本状态。

训练实现层面,所有本地 ES/GRPO 运行均为全参数更新、使用 NVIDIA A100-SXM4-80GB。ES 每步由独立种子重建全模型高斯方向,在八个单 GPU vLLM 引擎上完成扰动 rollout,然后重建方向作中心更新;数学任务中验证器正确/格式正确但答案错误/格式错误的奖励分别为 1/0.1/0。Easy 与 Hard 的 ES 均用 σ=1.5×10−3、α=2.5×10−4;评估分别限制 2,048 与 8,192 新 token。这些细节说明作者比较的是一个具体的、奖励标准化的一点全参数 ES 实现,而不是任意 ES。

🔍适用范围与局限

  1. 覆盖不等于全面更强。本文直接展示的权衡是 GRPO 通常更强的 Pass@1 与 ES 更强的大 K Pass@K;具体任务、模型与采样预算改变时,优势排序也可能改变。
  2. 理论是带条件的桥梁。种群 JSD 到更新后中心策略 Pass@K 的推导依赖 verifier 相关异质性、奖励对齐选择、以及更新误差被成功裕量控制。经验结果支持这些机制在所测设置可发生,不是无条件普适定理。
  3. “未必遗忘”不是“保证不忘”。研究只在一次后训练的设置与有限 held-out 基准中考察;论文未来工作明确要求跨多任务、长期程持续学习检验。
  4. 更小种群随模型变大而足够,是该缩放实验的观察。它没有证明所有架构、任务、奖励密度和扰动尺度都遵循同一规律。
  5. 代码可运行不等于所有结果已独立复现。仓库是作者发布的复现工件;本报告核验其存在、声明与结构,未在本地重跑 A100 训练或全部基准。

在本文的受控实验和带条件理论下,ES 被定位为一种在“单次命中—多次采样覆盖”轴上具有不同归纳偏好的推理后训练范式,而不只是 GRPO 的低内存替代方案。

🔗原始来源