🎯问题背景:步级偏好的盲区与自纠正的优化挑战

尽管前沿大语言模型(LLM)持续进步,较小LLM在复杂数学推理中仍困难重重——早期错误会传播至整个解。为提供更局部的学习信号,近期研究转向步级目标(Step-DPO、process supervision等),但它们主要优化"更好推理续写"的偏好,不显式纠正已生成的错误步

这催生了自纠正范式——引入自改进循环让模型在推理时检测并纠正自身错误。然而训练LLM自纠正存在优化挑战:SCoRe指出SFT纠正轨迹易受分布偏移和行为崩塌,提出on-policy RL方案;S²R、SuperCorrect等进一步分解为SFT初始化+RL两阶段。但这些初始化策略主要强制模型遵循特定模板以服务自纠正阶段,而非显式强化步级推理

1.1 核心动机:步级推理是自纠正的基础

步级自纠正需同时优化两个目标:评估推理步正确性生成纠正替代。当步级推理能力不足时,联合优化会产生噪声信号并导致错误复合。SFS-DPO因此采用两阶段策略:先用步级偏好优化建立强步级推理基础,再训练自纠正——假设步级偏好信号为后续自纠正提供更强基础。

1.2 方法对比定位(Table 1)

论文Table 1系统对比了自纠正方法的能力覆盖与训练规模:

方法 Init. Opt. 训练规模 Init/Opt 自发 错误检测 错误批评 外部教师
SCoReRLRL12K/12K
SuperCorrectSFTStep RL100K/10K
LEMMASFT—/88.9K
S3C-MATHSFT—/927K
SPOCSFTRL860K/—
S²RSFTRL3.1K/10K
SFS-DPO (本文)Step RLStep RL10K/8.4K
SFS-DPO-R (本文)Step RLStep RL10K/8.4K

SFS-DPO/SFS-DPO-R以仅10K+8.4K训练数据实现与S3C-MATH(927K)、SPOC(860K)等可比的能力覆盖,数据效率显著优于先前方法。

🏗️SFS-DPO核心架构:两阶段框架与三类步

2.1 任务形式化

自纠正被形式化为带显式错误检测与修复的多步轨迹生成。给定问题x,模型πθ生成轨迹 {sj}j=1M = (s1, ..., sM, ŷ),每步 sj ~ πθ(·|x, s<j)。每步可取三种类型之一:

当生成错误检测步时,模型生成纠正步替换错误推理。最终答案ŷ从终端纠正轨迹获得。

2.2 两阶段设计动机

步级自纠正需同时优化"评估步正确性"与"生成纠正替代"。当步级推理能力不足时,联合优化产生噪声信号并错误复合。因此SFS-DPO采用:

  1. Stage 1: 步级偏好优化初始化——通过对齐正确中间推理步强化步级推理能力
  2. Stage 2: 步级自纠正——训练显式自检与自纠,将步级偏好转化为定向多步推理改进

假设:步级偏好信号为后续自纠正提供更强基础,使模型在识别错误步后能更有效地生成纠正步。

🎓Stage 1:步级偏好优化初始化

第一阶段用强化学习目标初始化模型,最大化正确步sk+似然同时最小化错误步sk似然。优化目标:

LPre(θ) = −E(x,{si}i=1k−1,sk+,sk)~D[ log σ( β( log πθ(sk+|x,{si}i=1k−1) − log πθ(sk|x,{si}i=1k−1) ) ) ]

其中πθ为待优化策略模型,β控制偏好正则化强度,D为步级偏好对数据集。此阶段作为初始化,为后续步级自纠正优化建立强基础。本文采用Step-DPO的步级偏好优化框架实现此初始化阶段。

Stage 2:步级自纠正训练

在用RL步级监督信号装备模型后,进一步通过监督模型识别并纠正错误推理步来启用显式自纠正。给定正确轨迹{s1,...,sk−1}后的错误步sk,构造偏好目标:偏好自纠正续写ck+胜过未纠正续写sk+1(错误未被检测时本会生成的后续步)。损失:

LSC(θ) = −E(x,{si}i=1k−1,sk,ck+,sk+1)~DSC[ log σ( β log[ πθ(ck+|x,{si}i=1k−1,sk) / πref(ck+|x,{si}i=1k−1,sk) ] − β log[ πθ(sk+1|x,{si}i=1k−1,sk) / πref(sk+1|x,{si}i=1k−1,sk) ] ) ]

πref为冻结基线模型;sk为错误推理步;sk+1为错误未被检测时的后续续写;ck+为显式解决检测错误的纠正推理步。两个变体区别在于ck+的构造方式。

4.1 SFS-DPO(teacher-free)

自纠正步通过显式检测并修复错误步构造:

ck+ = {dk−1, sk+}

其中dk−1为显式错误检测信号(标记sk中的缺陷),sk+为解决检测错误的纠正推理步。此公式实现无教师自纠正,仅依赖模型生成的检测与纠正信号。

4.2 SFS-DPO-R(teacher-assisted)

SFS-DPO-R进一步引入外部教师监督提供更丰富纠正信号。用强教师模型生成对前一步为何错误的显式解释。纠正步定义为:

ck+ = {dk−1, rk−1, sk+}

其中rk−1教师生成的解释性推理,解释sk中的错误。通过用高质量解释性推理增强纠正,SFS-DPO-R以额外教师依赖为代价提供更强监督。实验中用GPT-4o生成rationale。两个变体的对比旨在量化质量与外部模型依赖的权衡

4.3 数据构造

从Step-DPO原始10K数据集收集样本。对每个样本,将拒绝的推理步追加到初始推理后形成含错误步的新前缀,用后续拒绝步作为rejected样本。chosen步将正确推理步与自纠正信号拼接(信号短语集见论文Figure 6,含"Wait"、"Let me recheck"、"The previous step is incorrect."等)。由此得到无资源SFS-DPO数据集8,416样本。SFS-DPO-R额外用GPT-4o为错误步生成显式解释,插入自纠正信号与正确步之间。

4.4 训练设置

📊主实验:7骨干×4基准全面评测

5.1 实验设置

5.2 主结果(Table 2)

DeepSeekMath-7B-SFT

方法 MATH GSM8K GK2023 OCW Avg.
Base51.786.838.219.149.0
+ Step-DPO51.8 (+0.1)86.7 (−0.1)43.4 (+5.2)18.0 (−1.1)50.0 (+1.0)
+ SFS-DPO52.2* (+0.5)87.6* (+0.8)43.9 (+5.7)23.2 (+4.1)51.7 (+2.7)
+ SFS-DPO-R52.2* (+0.5)88.0* (+1.2)43.9 (+5.7)25.0 (+5.9)52.3 (+3.3)

Qwen2-7B-Instruct

方法 MATH GSM8K GK2023 OCW Avg.
Base55.785.039.720.250.2
+ Step-DPO57.1 (+1.4)86.2 (+1.2)42.9 (+3.2)21.3 (+1.1)51.9 (+1.7)
+ SFS-DPO58.6* (+2.9)86.6* (+1.6)46.0 (+6.3)20.6 (+0.4)53.0 (+2.8)
+ SFS-DPO-R59.1* (+3.4)86.0 (+1.0)44.7 (+5.0)22.1 (+1.9)53.0 (+2.8)

Qwen2.5-Math-7B-Instruct(最大OOD增益)

方法 MATH GSM8K GK2023 OCW Avg.
Base83.695.257.423.965.0
+ Step-DPO84.6 (+1.0)95.8 (+0.6)67.0 (+9.6)31.6 (+7.7)69.8 (+4.8)
+ SFS-DPO84.7 (+1.1)95.8 (+0.6)68.3 (+10.9)32.0 (+8.1)70.2 (+5.2)
+ SFS-DPO-R85.0* (+1.4)96.0 (+0.8)67.8 (+10.4)32.7 (+8.8)70.4 (+5.4)

Qwen3-8B / Llama-3.1-8B-Instruct / Qwen2.5-14B-Instruct(增益较小的强骨干)

骨干 方法 MATH GSM8K GK2023 OCW Avg.
Qwen3-8B+ Step-DPO73.4 (+0.5)92.8 (+0.0)58.2 (−0.2)31.3 (+0.0)63.9 (+0.0)
+ SFS-DPO73.5 (+0.6)93.1 (+0.3)58.4 (+0.0)33.1 (+1.8)64.5 (+0.6)
+ SFS-DPO-R73.7* (+0.8)93.9* (+1.1)59.0 (+0.6)34.2 (+2.9)65.2 (+1.3)
Llama-3.1-8B-Instruct+ Step-DPO51.8 (+1.4)86.4 (+0.2)41.8 (+3.4)27.6 (+2.6)51.9 (+1.9)
+ SFS-DPO51.0 (+0.6)86.7 (+0.5)42.1 (+3.7)28.3 (+3.3)52.0 (+2.0)
+ SFS-DPO-R51.7 (+1.3)87.1* (+0.9)42.6 (+4.2)27.9 (+2.9)52.3 (+2.3)
Qwen2.5-14B-Instruct+ Step-DPO79.3 (+0.5)94.1 (+0.3)65.7 (+0.2)36.0 (−1.5)68.8 (−0.1)
+ SFS-DPO79.2 (+0.4)94.5* (+0.7)65.7 (+0.2)38.2 (+0.7)69.4 (+0.5)
+ SFS-DPO-R79.4 (+0.6)94.5* (+0.7)67.8 (+2.3)37.7 (+0.2)69.9 (+1.0)

5.3 三大发现

发现1:显式步级自纠正优于仅步级偏好学习。 跨7骨干×2 in-domain数据集,Step-DPO提供有限且不一致的改进(多数<1%,GSM8K上对Qwen2-7B-SFT和DeepSeekMath-7B-SFT甚至plateau或略降)。SFS-DPO/SFS-DPO-R在所有设置上均改进基模型,且SFS-DPO在14个设置中11个、SFS-DPO-R在12/14设置中超越Step-DPO。这表明自纠正训练在教模型何时及如何修订推理的同时提升推理性能。

发现2:SFS-DPO-R的解释性推理提供额外监督。 7骨干平均,SFS-DPO在MATH提升+1.11%、GSM8K +0.69%;SFS-DPO-R进一步提升至MATH +1.36%、GSM8K +0.87%。SFS-DPO-R对SFS-DPO的一致优势表明,对错误为何错误的显式解释性推理提供了超越纠正本身的额外监督——通过暴露错误原因,鼓励更准确的错误定位和更定向的修复。

发现3:OOD泛化稳健,自纠正策略可迁移。 Step-DPO在OOD上行为不一致(Qwen2-7B-SFT的GK2023退化、Qwen2.5-14B的OCW退化)。SFS-DPO/SFS-DPO-R在所有骨干和数据集上持续保持或改进。Qwen2-7B-Instruct + SFS-DPO在GK2023上+6.3;Qwen2.5-Math-7B-Instruct + SFS-DPO-R实现GK2023 +10.4、OCW +8.8的最大OOD增益。SFS-DPO与SFS-DPO-R在OOD上差距小,表明自生成纠正信号已捕获OOD推理所需的大部分可迁移结构

关于强骨干增益较小的诚实说明: Qwen2.5-14B-Instruct、Qwen3-8B、Llama-3.1-8B-Instruct上增益较小。论文推测这些骨干训练前已更频繁自纠正,引入新纠正行为的空间更小(详见Appendix B)。

🔬自纠正基线对比与初始化消融

6.1 与自纠正SFT基线对比(Table 3, Llama-3.1-8B-Instruct)

方法 MATH GSM8K SC Rate (%) Error Recall (%)
LEMMA48.583.345.349.9
S²R48.784.446.554.6
SFS-DPO51.086.728.833.2
SFS-DPO-R51.787.123.935.9

SFS-DPO/SFS-DPO-R在MATH和GSM8K上均超越LEMMA/S²R,但自纠正率更低(23.9–28.8% vs. 45.3–46.5%),Error Recall也更低。这表明纠正更多或检测更多错误并不等于更好性能。SFT方法可能因分布偏移和行为崩塌而偏向过度自纠正——遵循纠正模板而非选择性修订真实错误。

6.2 初始化阶段消融(Table 4, Qwen2-7B)

骨干 初始化策略 MATH GSM8K
SFTStep RL (本文)55.687.9
No init.53.1 (−2.5)87.3 (−0.6)
No init. + Joint Training53.3 (−2.2)84.1 (−3.8)
RL53.3 (−2.2)83.6 (−4.3)
InstructStep RL (本文)58.686.6
No init.53.1 (−4.1)85.6 (−1.0)
No init. + Joint Training56.9 (−1.7)86.4 (−0.2)
RL55.7 (−0.9)86.4 (−0.2)

三个关键结论:

退化在更难的MATH基准和SFT设置上更明显,凸显建立强步级推理基础再优化自纠正行为的重要性。

🧠自纠正行为分析:频率、选择性与位置

7.1 自纠正率与性能的正相关(Figure 2)

SC率与整体性能呈正相关——SFS-DPO-R框架的自纠正能力在提升推理准确率中起重要作用。但高SC率不一定转化为更好准确率:LEMMA/S²R达高SC率但任务准确率更低(Table 3)。SFS-DPO/SFS-DPO-R以更低SC率取得更强性能,表明框架学会更选择性地、更有效地自纠正——主要在原推理可能失败的更难样例上自纠正。有效自纠正不仅需知道"如何纠正",还需知道"何时不纠正"。SC率单独不足以作为自纠正质量的独立指标

7.2 自纠正步数分布(Figure 3)

分析SFS-DPO-R在GSM8K/MATH上含自纠正信号的解中自纠正步总数分布:多数解仅含少数自纠正步,单次纠正最常见,频率随纠正次数增加而递减。超过三次纠正的案例相对少见,表明模型不依赖重复或强制修订。

7.3 自纠正位置分布(Figure 4)

自纠正出现广泛跟随推理长度分布,而非集中在特定位置——无对特定推理阶段的强位置偏置。这表明SFS-DPO-R在多步推理中鼓励稳定且定向的自纠正行为。

7.4 训练前后的自纠正率变化(Table 6)

骨干 Base SC Rate SFS-DPO SFS-DPO-R
DeepSeekMath-7B-SFT8.114.219.1
Qwen2-7B-SFT8.014.213.1
Qwen2-7B-Instruct5.312.514.9
Qwen2.5-Math-7B-Instruct21.035.742.1
Qwen3-8B35.826.928.8
Llama-3.1-8B-Instruct37.028.823.9
Qwen2.5-14B-Instruct37.543.846.6

训练前SC能力有限的骨干(DeepSeekMath/Qwen2系列)训练后SC率提升。但Llama-3.1-8B-Instruct和Qwen3-8B训练后SC率下降而性能提升——再次证明有效自纠正依赖选择性和准确修订而非频率。

📝案例研究:从重复错误到精准定位

8.1 案例1(Table 5):清洁工百分比问题

问题:80教室×15分钟/教室,5天8小时工作日,求清洁时间占工作日百分比。

8.2 案例2(Table 7):音乐会人数高估问题

问题:Courtney报48人,Kelly称Courtney高估20%,求实际人数。

8.3 案例3(Table 8):传球训练问题——过度纠正的反例

问题:11人球队每人向其他10人传球3次,求总传球数。正确答案165(11×10×3/2)。

8.4 案例4(Table 9):Cauchy-Schwarz不等式求最大值

问题:非负实数a+b+c+d=1,求a²+b²+c²+d²最大值。正确答案1/4。

此案例展示SFS-DPO-R即使在自身推理出错时也能通过自纠正机制恢复正确答案——这正是自纠正训练的核心价值。

🌍局限、未来方向与产业意义

9.1 论文诚实声明的局限

9.2 未来方向

9.3 产业意义

📄关键数据速览与总结

论文信息:

· Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan. "Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs." arXiv:2608.11573v1, 12 Aug 2026.

· 单位:Nanyang Technological University / National University of Singapore / VinUniversity / Institute for Infocomm Research (IR), A*STAR

· 联系:{vuducanh001, hoangmin003, ponhvoan002, anhtuan.luu}@ntu.edu.sg

· 许可:CC BY 4.0

核心数据速览:

· 骨干模型:7个开源LLM(7B–14B)

· 训练数据:Init 10K(Step-DPO数据集)+ SC 8.4K(SFS-DPO/SFS-DPO-R)

· 训练配置:Init 3 epochs batch 4;SC 4 epochs batch 8;AdamW lr=5e-7

· In-domain:MATH(5000) / GSM8K(1319)

· OOD:GK2023(385) / OCW(272)

· SFS-DPO在14个in-domain设置中11个、SFS-DPO-R在12/14设置中超越Step-DPO

· 7骨干平均:SFS-DPO MATH +1.11% / GSM8K +0.69%;SFS-DPO-R MATH +1.36% / GSM8K +0.87%

· 最大in-domain增益:Qwen2-7B-Instruct + SFS-DPO-R MATH +3.4

· 最大OOD增益:Qwen2.5-Math-7B-Instruct + SFS-DPO-R GK2023 +10.4 / OCW +8.8

· 自纠正率对比:SFS-DPO/R 23.9–28.8% vs LEMMA/S²R 45.3–46.5%(更低SC率,更高准确率)

· 统计检验:单边McNemar's test, p<0.05(仅in-domain)

两阶段框架:

· Stage 1(Initialization):步级偏好优化(Step-DPO式),强化步级推理

· Stage 2(Step-wise Self-Correction):训练显式自检+自纠

· SFS-DPO:c_k+ = {detection signal, corrected step}(teacher-free)

· SFS-DPO-R:c_k+ = {detection signal, teacher rationale, corrected step}(GPT-4o辅助)

三类步:

· solution step(标准推理步)

· error-detection step(错误检测信号)

· fixed step(纠正步,替换错误步)

核心洞察:

· 步级推理是自纠正的基础——联合优化产生噪声,顺序学习更有效

· 显式建模错误识别与修复(而非仅偏好更好续写)对鲁棒数学推理至关重要

· 自纠正率≠性能——选择性纠正比频繁纠正更重要

· 教师rationale提供额外监督但引入教师依赖(质量vs依赖的权衡)

· 自生成纠正信号已捕获OOD推理所需的大部分可迁移结构

初始化消融(Table 4):

· 移除init → MATH −2.5~−4.1

· Joint training → GSM8K −3.8~−4.3(顺序学习优于混合目标)

· 标准RL init不如Step RL init

诚实声明:

· 本报告所有数值均来自论文原文(Table 1-6, Figure 2-7),已逐项核对

· 论文诚实声明局限:SFS-DPO-R依赖教师(传播teacher bias);仅评估数学推理;模型规模7–14B

· 强骨干(Qwen2.5-14B/Qwen3-8B/Llama-3.1-8B)增益较小,论文推测因训练前已更频繁自纠正

· OOD不报显著性(样本量小,McNemar's test统计功效不足)