问题背景:步级偏好的盲区与自纠正的优化挑战
尽管前沿大语言模型(LLM)持续进步,较小LLM在复杂数学推理中仍困难重重——早期错误会传播至整个解。为提供更局部的学习信号,近期研究转向步级目标(Step-DPO、process supervision等),但它们主要优化"更好推理续写"的偏好,不显式纠正已生成的错误步。
这催生了自纠正范式——引入自改进循环让模型在推理时检测并纠正自身错误。然而训练LLM自纠正存在优化挑战:SCoRe指出SFT纠正轨迹易受分布偏移和行为崩塌,提出on-policy RL方案;S²R、SuperCorrect等进一步分解为SFT初始化+RL两阶段。但这些初始化策略主要强制模型遵循特定模板以服务自纠正阶段,而非显式强化步级推理。
1.1 核心动机:步级推理是自纠正的基础
步级自纠正需同时优化两个目标:评估推理步正确性与生成纠正替代。当步级推理能力不足时,联合优化会产生噪声信号并导致错误复合。SFS-DPO因此采用两阶段策略:先用步级偏好优化建立强步级推理基础,再训练自纠正——假设步级偏好信号为后续自纠正提供更强基础。
1.2 方法对比定位(Table 1)
论文Table 1系统对比了自纠正方法的能力覆盖与训练规模:
| 方法 | Init. | Opt. | 训练规模 Init/Opt | 自发 | 错误检测 | 错误批评 | 外部教师 |
|---|---|---|---|---|---|---|---|
| SCoRe | RL | RL | 12K/12K | ✗ | ✗ | ✗ | ✗ |
| SuperCorrect | SFT | Step RL | 100K/10K | ✔ | ✔ | ✔ | ✔ |
| LEMMA | — | SFT | —/88.9K | ✔ | ✔ | ✗ | ✗ |
| S3C-MATH | — | SFT | —/927K | ✔ | ✔ | ✔ | ✔ |
| SPOC | SFT | RL | 860K/— | ✔ | ✔ | ✔ | ✗ |
| S²R | SFT | RL | 3.1K/10K | ✔ | ✔ | ✔ | ✗ |
| SFS-DPO (本文) | Step RL | Step RL | 10K/8.4K | ✔ | ✔ | ✗ | ✗ |
| SFS-DPO-R (本文) | Step RL | Step RL | 10K/8.4K | ✔ | ✔ | ✔ | ✔ |
SFS-DPO/SFS-DPO-R以仅10K+8.4K训练数据实现与S3C-MATH(927K)、SPOC(860K)等可比的能力覆盖,数据效率显著优于先前方法。
SFS-DPO核心架构:两阶段框架与三类步
2.1 任务形式化
自纠正被形式化为带显式错误检测与修复的多步轨迹生成。给定问题x,模型πθ生成轨迹 {sj}j=1M = (s1, ..., sM, ŷ),每步 sj ~ πθ(·|x, s<j)。每步可取三种类型之一:
- solution step(解答步):标准推理步
- error-detection step(错误检测步):显式信号(可选附推理)指示前一步错误
- fixed step(纠正步):错误步的纠正版本,替换轨迹中的错误推理
当生成错误检测步时,模型生成纠正步替换错误推理。最终答案ŷ从终端纠正轨迹获得。
2.2 两阶段设计动机
步级自纠正需同时优化"评估步正确性"与"生成纠正替代"。当步级推理能力不足时,联合优化产生噪声信号并错误复合。因此SFS-DPO采用:
- Stage 1: 步级偏好优化初始化——通过对齐正确中间推理步强化步级推理能力
- Stage 2: 步级自纠正——训练显式自检与自纠,将步级偏好转化为定向多步推理改进
假设:步级偏好信号为后续自纠正提供更强基础,使模型在识别错误步后能更有效地生成纠正步。
Stage 1:步级偏好优化初始化
第一阶段用强化学习目标初始化模型,最大化正确步sk+似然同时最小化错误步sk−似然。优化目标:
LPre(θ) = −E(x,{si}i=1k−1,sk+,sk−)~D[ log σ( β( log πθ(sk+|x,{si}i=1k−1) − log πθ(sk−|x,{si}i=1k−1) ) ) ]
其中πθ为待优化策略模型,β控制偏好正则化强度,D为步级偏好对数据集。此阶段作为初始化,为后续步级自纠正优化建立强基础。本文采用Step-DPO的步级偏好优化框架实现此初始化阶段。
Stage 2:步级自纠正训练
在用RL步级监督信号装备模型后,进一步通过监督模型识别并纠正错误推理步来启用显式自纠正。给定正确轨迹{s1,...,sk−1}后的错误步sk−,构造偏好目标:偏好自纠正续写ck+胜过未纠正续写sk+1−(错误未被检测时本会生成的后续步)。损失:
LSC(θ) = −E(x,{si}i=1k−1,sk−,ck+,sk+1−)~DSC[ log σ( β log[ πθ(ck+|x,{si}i=1k−1,sk−) / πref(ck+|x,{si}i=1k−1,sk−) ] − β log[ πθ(sk+1−|x,{si}i=1k−1,sk−) / πref(sk+1−|x,{si}i=1k−1,sk−) ] ) ]
πref为冻结基线模型;sk−为错误推理步;sk+1−为错误未被检测时的后续续写;ck+为显式解决检测错误的纠正推理步。两个变体区别在于ck+的构造方式。
4.1 SFS-DPO(teacher-free)
自纠正步通过显式检测并修复错误步构造:
ck+ = {dk−1, sk+}
其中dk−1为显式错误检测信号(标记sk−中的缺陷),sk+为解决检测错误的纠正推理步。此公式实现无教师自纠正,仅依赖模型生成的检测与纠正信号。
4.2 SFS-DPO-R(teacher-assisted)
SFS-DPO-R进一步引入外部教师监督提供更丰富纠正信号。用强教师模型生成对前一步为何错误的显式解释。纠正步定义为:
ck+ = {dk−1, rk−1, sk+}
其中rk−1为教师生成的解释性推理,解释sk−中的错误。通过用高质量解释性推理增强纠正,SFS-DPO-R以额外教师依赖为代价提供更强监督。实验中用GPT-4o生成rationale。两个变体的对比旨在量化质量与外部模型依赖的权衡。
4.3 数据构造
从Step-DPO原始10K数据集收集样本。对每个样本,将拒绝的推理步追加到初始推理后形成含错误步的新前缀,用后续拒绝步作为rejected样本。chosen步将正确推理步与自纠正信号拼接(信号短语集见论文Figure 6,含"Wait"、"Let me recheck"、"The previous step is incorrect."等)。由此得到无资源SFS-DPO数据集8,416样本。SFS-DPO-R额外用GPT-4o为错误步生成显式解释,插入自纠正信号与正确步之间。
4.4 训练设置
- Init阶段:Step-DPO 10K数据集(来自GSM8K+MATH训练集);3 epochs;batch size 4
- SC阶段:SFS-DPO/SFS-DPO-R 8.4K数据集;4 epochs;batch size 8
- 优化器:AdamW;学习率5×10−7;warmup ratio 0.02
主实验:7骨干×4基准全面评测
5.1 实验设置
- 骨干模型(7个):DeepSeekMath-7B-SFT、Qwen2-7B-SFT、Qwen2-7B-Instruct、Qwen2.5-Math-7B-Instruct、Qwen3-8B、Llama-3.1-8B-Instruct、Qwen2.5-14B-Instruct
- In-domain基准:MATH(5000题)、GSM8K(1319题)
- OOD基准:GaoKao2023/GK2023(385题,2023高考竞赛级数学)、OCWCourses/OCW(272题,本科级STEM多步推理)
- 解码:greedy decoding
- 统计检验:单边McNemar's test,p<0.05标记*(仅in-domain,OOD样本量小不报)
- 基线:Step-DPO(主要对比)、LEMMA、S²R(自纠正SFT基线)
- 指标:答案准确率;自纠正率(模型决定自纠正的解占比);Error Recall(被自纠正信号标记的错误步占比)
5.2 主结果(Table 2)
DeepSeekMath-7B-SFT
| 方法 | MATH | GSM8K | GK2023 | OCW | Avg. |
|---|---|---|---|---|---|
| Base | 51.7 | 86.8 | 38.2 | 19.1 | 49.0 |
| + Step-DPO | 51.8 (+0.1) | 86.7 (−0.1) | 43.4 (+5.2) | 18.0 (−1.1) | 50.0 (+1.0) |
| + SFS-DPO | 52.2* (+0.5) | 87.6* (+0.8) | 43.9 (+5.7) | 23.2 (+4.1) | 51.7 (+2.7) |
| + SFS-DPO-R | 52.2* (+0.5) | 88.0* (+1.2) | 43.9 (+5.7) | 25.0 (+5.9) | 52.3 (+3.3) |
Qwen2-7B-Instruct
| 方法 | MATH | GSM8K | GK2023 | OCW | Avg. |
|---|---|---|---|---|---|
| Base | 55.7 | 85.0 | 39.7 | 20.2 | 50.2 |
| + Step-DPO | 57.1 (+1.4) | 86.2 (+1.2) | 42.9 (+3.2) | 21.3 (+1.1) | 51.9 (+1.7) |
| + SFS-DPO | 58.6* (+2.9) | 86.6* (+1.6) | 46.0 (+6.3) | 20.6 (+0.4) | 53.0 (+2.8) |
| + SFS-DPO-R | 59.1* (+3.4) | 86.0 (+1.0) | 44.7 (+5.0) | 22.1 (+1.9) | 53.0 (+2.8) |
Qwen2.5-Math-7B-Instruct(最大OOD增益)
| 方法 | MATH | GSM8K | GK2023 | OCW | Avg. |
|---|---|---|---|---|---|
| Base | 83.6 | 95.2 | 57.4 | 23.9 | 65.0 |
| + Step-DPO | 84.6 (+1.0) | 95.8 (+0.6) | 67.0 (+9.6) | 31.6 (+7.7) | 69.8 (+4.8) |
| + SFS-DPO | 84.7 (+1.1) | 95.8 (+0.6) | 68.3 (+10.9) | 32.0 (+8.1) | 70.2 (+5.2) |
| + SFS-DPO-R | 85.0* (+1.4) | 96.0 (+0.8) | 67.8 (+10.4) | 32.7 (+8.8) | 70.4 (+5.4) |
Qwen3-8B / Llama-3.1-8B-Instruct / Qwen2.5-14B-Instruct(增益较小的强骨干)
| 骨干 | 方法 | MATH | GSM8K | GK2023 | OCW | Avg. |
|---|---|---|---|---|---|---|
| Qwen3-8B | + Step-DPO | 73.4 (+0.5) | 92.8 (+0.0) | 58.2 (−0.2) | 31.3 (+0.0) | 63.9 (+0.0) |
| + SFS-DPO | 73.5 (+0.6) | 93.1 (+0.3) | 58.4 (+0.0) | 33.1 (+1.8) | 64.5 (+0.6) | |
| + SFS-DPO-R | 73.7* (+0.8) | 93.9* (+1.1) | 59.0 (+0.6) | 34.2 (+2.9) | 65.2 (+1.3) | |
| Llama-3.1-8B-Instruct | + Step-DPO | 51.8 (+1.4) | 86.4 (+0.2) | 41.8 (+3.4) | 27.6 (+2.6) | 51.9 (+1.9) |
| + SFS-DPO | 51.0 (+0.6) | 86.7 (+0.5) | 42.1 (+3.7) | 28.3 (+3.3) | 52.0 (+2.0) | |
| + SFS-DPO-R | 51.7 (+1.3) | 87.1* (+0.9) | 42.6 (+4.2) | 27.9 (+2.9) | 52.3 (+2.3) | |
| Qwen2.5-14B-Instruct | + Step-DPO | 79.3 (+0.5) | 94.1 (+0.3) | 65.7 (+0.2) | 36.0 (−1.5) | 68.8 (−0.1) |
| + SFS-DPO | 79.2 (+0.4) | 94.5* (+0.7) | 65.7 (+0.2) | 38.2 (+0.7) | 69.4 (+0.5) | |
| + SFS-DPO-R | 79.4 (+0.6) | 94.5* (+0.7) | 67.8 (+2.3) | 37.7 (+0.2) | 69.9 (+1.0) |
5.3 三大发现
发现1:显式步级自纠正优于仅步级偏好学习。 跨7骨干×2 in-domain数据集,Step-DPO提供有限且不一致的改进(多数<1%,GSM8K上对Qwen2-7B-SFT和DeepSeekMath-7B-SFT甚至plateau或略降)。SFS-DPO/SFS-DPO-R在所有设置上均改进基模型,且SFS-DPO在14个设置中11个、SFS-DPO-R在12/14设置中超越Step-DPO。这表明自纠正训练在教模型何时及如何修订推理的同时提升推理性能。
发现2:SFS-DPO-R的解释性推理提供额外监督。 7骨干平均,SFS-DPO在MATH提升+1.11%、GSM8K +0.69%;SFS-DPO-R进一步提升至MATH +1.36%、GSM8K +0.87%。SFS-DPO-R对SFS-DPO的一致优势表明,对错误为何错误的显式解释性推理提供了超越纠正本身的额外监督——通过暴露错误原因,鼓励更准确的错误定位和更定向的修复。
发现3:OOD泛化稳健,自纠正策略可迁移。 Step-DPO在OOD上行为不一致(Qwen2-7B-SFT的GK2023退化、Qwen2.5-14B的OCW退化)。SFS-DPO/SFS-DPO-R在所有骨干和数据集上持续保持或改进。Qwen2-7B-Instruct + SFS-DPO在GK2023上+6.3;Qwen2.5-Math-7B-Instruct + SFS-DPO-R实现GK2023 +10.4、OCW +8.8的最大OOD增益。SFS-DPO与SFS-DPO-R在OOD上差距小,表明自生成纠正信号已捕获OOD推理所需的大部分可迁移结构。
关于强骨干增益较小的诚实说明: Qwen2.5-14B-Instruct、Qwen3-8B、Llama-3.1-8B-Instruct上增益较小。论文推测这些骨干训练前已更频繁自纠正,引入新纠正行为的空间更小(详见Appendix B)。
自纠正基线对比与初始化消融
6.1 与自纠正SFT基线对比(Table 3, Llama-3.1-8B-Instruct)
| 方法 | MATH | GSM8K | SC Rate (%) | Error Recall (%) |
|---|---|---|---|---|
| LEMMA | 48.5 | 83.3 | 45.3 | 49.9 |
| S²R | 48.7 | 84.4 | 46.5 | 54.6 |
| SFS-DPO | 51.0 | 86.7 | 28.8 | 33.2 |
| SFS-DPO-R | 51.7 | 87.1 | 23.9 | 35.9 |
SFS-DPO/SFS-DPO-R在MATH和GSM8K上均超越LEMMA/S²R,但自纠正率更低(23.9–28.8% vs. 45.3–46.5%),Error Recall也更低。这表明纠正更多或检测更多错误并不等于更好性能。SFT方法可能因分布偏移和行为崩塌而偏向过度自纠正——遵循纠正模板而非选择性修订真实错误。
6.2 初始化阶段消融(Table 4, Qwen2-7B)
| 骨干 | 初始化策略 | MATH | GSM8K |
|---|---|---|---|
| SFT | Step RL (本文) | 55.6 | 87.9 |
| No init. | 53.1 (−2.5) | 87.3 (−0.6) | |
| No init. + Joint Training | 53.3 (−2.2) | 84.1 (−3.8) | |
| RL | 53.3 (−2.2) | 83.6 (−4.3) | |
| Instruct | Step RL (本文) | 58.6 | 86.6 |
| No init. | 53.1 (−4.1) | 85.6 (−1.0) | |
| No init. + Joint Training | 56.9 (−1.7) | 86.4 (−0.2) | |
| RL | 55.7 (−0.9) | 86.4 (−0.2) |
三个关键结论:
- 移除初始化 → 明显退化(MATH −2.5~−4.1):直接优化自纠正信号而无强推理基础是不够的
- 联合训练也有害(GSM8K −3.8~−4.3):步级推理与自纠正顺序学习优于单一混合目标
- 标准RL初始化不如Step RL:步级偏好优化为后续自纠正提供更强基础
退化在更难的MATH基准和SFT设置上更明显,凸显建立强步级推理基础再优化自纠正行为的重要性。
自纠正行为分析:频率、选择性与位置
7.1 自纠正率与性能的正相关(Figure 2)
SC率与整体性能呈正相关——SFS-DPO-R框架的自纠正能力在提升推理准确率中起重要作用。但高SC率不一定转化为更好准确率:LEMMA/S²R达高SC率但任务准确率更低(Table 3)。SFS-DPO/SFS-DPO-R以更低SC率取得更强性能,表明框架学会更选择性地、更有效地自纠正——主要在原推理可能失败的更难样例上自纠正。有效自纠正不仅需知道"如何纠正",还需知道"何时不纠正"。SC率单独不足以作为自纠正质量的独立指标。
7.2 自纠正步数分布(Figure 3)
分析SFS-DPO-R在GSM8K/MATH上含自纠正信号的解中自纠正步总数分布:多数解仅含少数自纠正步,单次纠正最常见,频率随纠正次数增加而递减。超过三次纠正的案例相对少见,表明模型不依赖重复或强制修订。
7.3 自纠正位置分布(Figure 4)
自纠正出现广泛跟随推理长度分布,而非集中在特定位置——无对特定推理阶段的强位置偏置。这表明SFS-DPO-R在多步推理中鼓励稳定且定向的自纠正行为。
7.4 训练前后的自纠正率变化(Table 6)
| 骨干 | Base SC Rate | SFS-DPO | SFS-DPO-R |
|---|---|---|---|
| DeepSeekMath-7B-SFT | 8.1 | 14.2 | 19.1 |
| Qwen2-7B-SFT | 8.0 | 14.2 | 13.1 |
| Qwen2-7B-Instruct | 5.3 | 12.5 | 14.9 |
| Qwen2.5-Math-7B-Instruct | 21.0 | 35.7 | 42.1 |
| Qwen3-8B | 35.8 | 26.9 | 28.8 |
| Llama-3.1-8B-Instruct | 37.0 | 28.8 | 23.9 |
| Qwen2.5-14B-Instruct | 37.5 | 43.8 | 46.6 |
训练前SC能力有限的骨干(DeepSeekMath/Qwen2系列)训练后SC率提升。但Llama-3.1-8B-Instruct和Qwen3-8B训练后SC率下降而性能提升——再次证明有效自纠正依赖选择性和准确修订而非频率。
案例研究:从重复错误到精准定位
8.1 案例1(Table 5):清洁工百分比问题
问题:80教室×15分钟/教室,5天8小时工作日,求清洁时间占工作日百分比。
- Base Qwen2-7B-SFT:计算1200分钟/480分钟=250%,发现>100%不合理但反复重复相同错误计算,陷入循环,未有效解决错误
- SFS-DPO-R:检测到百分比计算错误,定位错误源(应除以总工作小时40而非8小时),纠正计算得20/40×100%=50%,得正确答案
8.2 案例2(Table 7):音乐会人数高估问题
问题:Courtney报48人,Kelly称Courtney高估20%,求实际人数。
- Base Qwen2-7B-Instruct:错误地用48×0.8=38.4并取整为38(逻辑错误:高估20%不等于实际是报数的80%)
- SFS-DPO-R:识别错误,重新建模方程48=x+0.2x → x=48/1.2=40,得正确答案40
8.3 案例3(Table 8):传球训练问题——过度纠正的反例
问题:11人球队每人向其他10人传球3次,求总传球数。正确答案165(11×10×3/2)。
- Step-DPO:正确计算165
- S²R:先得165,然后过度自纠正反复验证,最终仍得165但过程冗长
- LEMMA:先正确得165,然后反复修订把正确推理路径改成错误答案
- SFS-DPO-R:执行定向纠正,得正确答案(注:此案例展示S²R/LEMMA的过度纠正问题,SFS-DPO-R的selective correction优势)
8.4 案例4(Table 9):Cauchy-Schwarz不等式求最大值
问题:非负实数a+b+c+d=1,求a²+b²+c²+d²最大值。正确答案1/4。
- Step-DPO:用Cauchy-Schwarz正确推导得1/4
- SFS-DPO-R:先用QM-AM不等式但推导出错(得上界1而非1/4),检测到错误后纠正,恢复正确最大值1/4
此案例展示SFS-DPO-R即使在自身推理出错时也能通过自纠正机制恢复正确答案——这正是自纠正训练的核心价值。
局限、未来方向与产业意义
9.1 论文诚实声明的局限
- 教师依赖:SFS-DPO-R依赖强模型生成rationale,引入额外教师依赖及教师偏差或错误的潜在传播
- 评估范围:聚焦数学推理(中间步自然良定义),开放性设置(如创意写作)的泛化未充分探索
- 模型规模:仅检验7–14B参数的中等规模LLM,更大更强模型的实验可加强claim
9.2 未来方向
- 扩展到更复杂数据集与开放性推理任务
- 在更大模型上验证框架可扩展性
- 探索减少SFS-DPO-R对教师依赖的方法(如自生成rationale)
9.3 产业意义
- 小模型可靠性:为7–14B开源LLM提供实用的自纠正训练方案,无需依赖超大模型即可提升数学推理可靠性
- 数据效率:仅10K+8.4K训练数据即实现与S3C-MATH(927K)、SPOC(860K)可比能力,训练成本低
- 两阶段范式可推广:"先强化步级推理,再训练自纠正"的顺序学习原则可启发其他需要基础能力+复合能力的任务
- 选择性纠正洞察:纠正频率≠纠正质量,对生产LLM的自纠正系统设计有指导意义——应优化纠正的选择性而非频率
- teacher-free变体可用:SFS-DPO无需外部教师,适合无法访问GPT-4o等闭源模型的场景
关键数据速览与总结
论文信息:
· Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan. "Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs." arXiv:2608.11573v1, 12 Aug 2026.
· 单位:Nanyang Technological University / National University of Singapore / VinUniversity / Institute for Infocomm Research (IR), A*STAR
· 联系:{vuducanh001, hoangmin003, ponhvoan002, anhtuan.luu}@ntu.edu.sg
· 许可:CC BY 4.0
核心数据速览:
· 骨干模型:7个开源LLM(7B–14B)
· 训练数据:Init 10K(Step-DPO数据集)+ SC 8.4K(SFS-DPO/SFS-DPO-R)
· 训练配置:Init 3 epochs batch 4;SC 4 epochs batch 8;AdamW lr=5e-7
· In-domain:MATH(5000) / GSM8K(1319)
· OOD:GK2023(385) / OCW(272)
· SFS-DPO在14个in-domain设置中11个、SFS-DPO-R在12/14设置中超越Step-DPO
· 7骨干平均:SFS-DPO MATH +1.11% / GSM8K +0.69%;SFS-DPO-R MATH +1.36% / GSM8K +0.87%
· 最大in-domain增益:Qwen2-7B-Instruct + SFS-DPO-R MATH +3.4
· 最大OOD增益:Qwen2.5-Math-7B-Instruct + SFS-DPO-R GK2023 +10.4 / OCW +8.8
· 自纠正率对比:SFS-DPO/R 23.9–28.8% vs LEMMA/S²R 45.3–46.5%(更低SC率,更高准确率)
· 统计检验:单边McNemar's test, p<0.05(仅in-domain)
两阶段框架:
· Stage 1(Initialization):步级偏好优化(Step-DPO式),强化步级推理
· Stage 2(Step-wise Self-Correction):训练显式自检+自纠
· SFS-DPO:c_k+ = {detection signal, corrected step}(teacher-free)
· SFS-DPO-R:c_k+ = {detection signal, teacher rationale, corrected step}(GPT-4o辅助)
三类步:
· solution step(标准推理步)
· error-detection step(错误检测信号)
· fixed step(纠正步,替换错误步)
核心洞察:
· 步级推理是自纠正的基础——联合优化产生噪声,顺序学习更有效
· 显式建模错误识别与修复(而非仅偏好更好续写)对鲁棒数学推理至关重要
· 自纠正率≠性能——选择性纠正比频繁纠正更重要
· 教师rationale提供额外监督但引入教师依赖(质量vs依赖的权衡)
· 自生成纠正信号已捕获OOD推理所需的大部分可迁移结构
初始化消融(Table 4):
· 移除init → MATH −2.5~−4.1
· Joint training → GSM8K −3.8~−4.3(顺序学习优于混合目标)
· 标准RL init不如Step RL init
诚实声明:
· 本报告所有数值均来自论文原文(Table 1-6, Figure 2-7),已逐项核对
· 论文诚实声明局限:SFS-DPO-R依赖教师(传播teacher bias);仅评估数学推理;模型规模7–14B
· 强骨干(Qwen2.5-14B/Qwen3-8B/Llama-3.1-8B)增益较小,论文推测因训练前已更频繁自纠正
· OOD不报显著性(样本量小,McNemar's test统计功效不足)