🏔️问题背景:智能体RL的监督鸿沟

现代LLM系统正从单轮响应生成转向多轮智能体交互——模型反复推理、行动、使用工具、从环境获取反馈。这种设置要求智能体做序列决策,其后果可能在许多交互步骤后才显现。强化学习因此成为LLM智能体的重要后训练范式,因为它直接针对环境/模拟器/验证器的任务级反馈进行优化。

然而,基于结果的智能体RL只提供粗粒度监督。在长程环境中,奖励通常是稀疏、延迟、轨迹级分配的:它们指示一个episode是否成功,但不指示哪些中间观察、动作或工具调用应该被强化或纠正。这在episode级结果与token级策略学习之间留下了监督鸿沟。一条失败的轨迹可能包含有用的部分行为但因少数局部错误而失败;一条成功的轨迹可能包含可复用策略但标量奖励从未识别它们。因此,仅基于结果的优化对长交互历史中的细粒度决策级信用分配提供有限指导。

1.1 核心洞察:hindsight信息

论文的关键观察是:已完成的轨迹揭示了在线决策时不可获得的hindsight。一旦episode终止,完整交互历史就揭示了哪些子目标已达成、智能体在哪里偏离了有效策略、哪些观察是决定性的、哪些行为模式可迁移到未来尝试。这与RL中的hindsight学习相关——已完成经验可被重新解释以改善稀疏反馈下的学习。

1.2 三个关键要求

论文指出,有效的hindsight监督在智能体RL中应满足三个要求:

现有方法的局限:许多hindsight方法将其视为静态经验、推理时上下文或检索记忆(如Reflexion、ExpeL)。自蒸馏方法的特权监督源通常是静态的、外部生成的,或独立于策略更新——当策略改进并遇到新状态和失败模式时,这种监督可能变得过时或与当前行为不匹配。SEED的核心创新在于通过自演化循环解决这一局限:最新策略检查点同时作为rollout actor和轨迹分析器,决策与hindsight监督共同进化。

🏗️SEED核心架构:两阶段自演化循环

SEED由两个训练阶段组成:

  1. Stage 1: Hindsight技能SFT——让策略模型学会分析完整交互历史,并生成可复用的行为指导(自然语言hindsight技能)
  2. Stage 2: 自演化OPD——当前策略快照同时收集在线策略轨迹并分析为hindsight技能;相同的采样动作在普通和技能增强上下文下重新评分,构造token级OPD信号,与RL联合优化

推理时移除analyzer,部署只需学到的策略——无需analyzer、技能库、检索模块或增强决策提示。这是SEED与许多现有hindsight方法的关键区别:技能仅在训练时作为特权监督,不增加部署开销。

2.1 问题形式化

长程智能体任务被形式化为部分可观测马尔可夫决策过程 (S, A, O, T, Ω, R, γ)。时间步t时,智能体接收观察ot,维护交互历史 ht = (o0, a0, o1, a1, ..., ot),按 at ~ πθ(·|ht) 生成动作。完成轨迹 τ = {(ot, at, rt)}t=0T-1,episode级结果 R(τ) 通常稀疏且仅在任务完成后可用。标准RL目标 J(θ) = Eτ~πθ[R(τ)] 暴露了核心挑战:环境只提供轨迹级反馈,但策略必须从分布在交互历史中的许多token级决策中学习。

🎓Stage 1:Hindsight技能监督微调

第一阶段初始化策略,使其具备分析完整交互历史并将可复用行为指导表达为自然语言hindsight技能的能力。

3.1 离线轨迹收集

首先用基础策略 πθbase 收集离线轨迹池。对每个训练任务 qj,运行 K0 = 8 次rollout。完整离线池 B = ∪Bj。每条轨迹包含任务描述、观察、动作、奖励和最终结果。这些轨迹在决策上下文中不含任何hindsight技能,确保SFT数据来自普通智能体-环境交互。

3.2 Hindsight技能标注

给定完成轨迹τ,外部分析器 Aext 产生hindsight技能标注 sτ = Aext(τ):

实验中使用 GLM-5.2 作为外部分析器。仅当生成的技能格式正确时保留标注(有效性指示 vτ ∈ {0,1})。接受的SFT集 Dsft = {(xτ, sτ) : τ ∈ B, vτ = 1}。

3.3 监督微调

微调策略模型从完成轨迹预测hindsight技能。标准负对数似然目标:

Lsft(θ) = −E(xτ,sτ)~Dsft[ Σ log πθ(sτ,ℓ | xτ, sτ,<ℓ) ]

关键设计:同一自回归模型稍后同时初始化RL actor和同步轨迹分析器。因此同一模型既能在普通交互历史下在环境中行动,又能从完成轨迹生成hindsight技能,无需单独训练的分析器。结果检查点 θsft 初始化后续RL策略。

3.4 Analyzer提示设计

分析器被要求返回JSON格式,包含两个字段:

重要约束:技能写成一条简短的面向策略的技能,而非轨迹的事后解释。

Stage 2:自演化在线策略蒸馏

第二阶段执行带有额外token级OPD信号的智能体RL。每次更新开始时,SEED冻结当前策略为 πθold。此快照既收集轨迹,又参数化提取hindsight技能的分析器。可训练策略 πθ 从 πθold 初始化,用环境驱动的GRPO和OPD目标共同优化。更新后,优化后的策略 πθ 成为下一迭代的策略快照。

4.1 在线策略hindsight技能生成

对每个任务提示q,用冻结策略采样一组N条轨迹 Gq = {τq(1), ..., τq(N)}。对每条完成轨迹,从同一策略快照实例化的分析器代理生成hindsight技能:

sq(n) = Aθold(xτq(n))

虽然actor和analyzer共享相同参数,但它们扮演不同角色:actor与环境交互,analyzer将完成轨迹总结为轨迹级hindsight技能。这种共享参数化创造了SEED的自演化循环——刷新 θold 同时改变actor遇到的轨迹和用于技能分析的模型能力,因此经验分布及其hindsight监督共同进化。

4.2 在线策略蒸馏目标(核心创新)

SEED保持原始在线策略动作固定,在技能增强上下文下重新评分。设H为确定性上下文增强函数,将生成的技能纳入普通交互历史。时间步t的技能增强历史:

q,n,t = H(hq,n,t, sq(n))

同一策略对相同采样动作token计算两个token级对数概率:

两个分支共享 πθ,但对应不同输入上下文:教师观察hindsight技能,学生仅从普通历史行动。教师提供detached训练时信号,梯度仅通过普通学生分支流动。

技能诱导概率偏移与置信门控

定义detached技能诱导对数概率偏移:

Δq,n,t,ℓ = sg[ℓskillq,n,t,ℓ − ℓθq,n,t,ℓ]

遵循SDAR,SEED将此偏移映射到置信门控:

gq,n,t,ℓ = σ(βopd · Δq,n,t,ℓ)

正偏移表示hindsight技能支持该采样token,产生更大门控值;负偏移衰减该token的辅助监督。

OPD损失

Lopd(θ) = Eq,n,t,ℓ[ mq,n,t,ℓ · gq,n,t,ℓ · sg[ℓskillq,n,t,ℓ − ℓθq,n,t,ℓ] ]

因为门控和教师对数概率都是detached的,梯度等价于门控加权负对数似然:

θLopd = −E[ m · g · ∇θθ ]

最小化它增加普通策略对教师认可的在线策略token的似然,在不暴露技能给推理时的情况下内化技能的行为效应

4.3 联合训练目标

除OPD外,SEED用组相对RL目标(GRPO)优化策略。轨迹级组相对优势:

Arlq,n = (R(τq(n)) − μq) / (σq + ε)

token级概率比 ρ = exp(ℓθ − ℓold),RL损失为clipped目标 + KL正则化。最终训练目标:

LSEED(θ) = Lrl(θ) + λopd · Lopd(θ)

RL项优化环境结果,OPD损失内化自生成hindsight技能的效应。更新后的策略成为下一迭代的 πθold,闭合自演化循环。

📊实验结果:三大文本基准全面领先

5.1 实验设置

5.2 主结果(Table 1)

Qwen2.5-3B-Instruct

方法 ALFWorld Avg Search-QA Avg WebShop Score WebShop Succ.
Vanilla21.931.76.70.8
GRPO75.036.479.863.3
GRPO+OPSD81.244.677.866.4
Skill-SD73.444.175.964.0
RLSD79.743.884.466.4
SDAR84.443.485.068.0
SEED (Ours)91.845.788.578.9

Qwen2.5-7B-Instruct

方法 ALFWorld Avg Search-QA Avg WebShop Score WebShop Succ.
GRPO81.242.080.972.6
SDAR85.949.089.482.8
SEED (Ours)96.148.689.778.1

Qwen3-1.7B-Instruct

方法 ALFWorld Avg Search-QA Avg WebShop Score WebShop Succ.
GRPO46.140.867.338.3
SDAR53.941.976.858.6
SEED (Ours)92.042.287.177.3

5.3 三大发现

发现1:SEED通过密集监督持续超越仅基于结果的RL。 相对GRPO,SEED在三个骨干上提升ALFWorld宏平均14.9-45.9点,Search-QA 1.4-9.3点,WebShop分数8.7-19.8点,成功率5.5-39.0点。相对Skill-GRPO(用技能条件化探索但仍广播单一终端奖励导出的优势到所有有效token),SEED进一步提升ALFWorld 26.6-70.9点。这些持续改进证明密集token级hindsight监督比仅基于结果的优化提供更有效的信用分配。

发现2:内化技能比插入提示更有效。 Skill-Prompt(仅在评估时提供技能)在所有三个骨干的每个聚合指标上都低于SEED。SEED在12个聚合比较中的11个超过Skill-GRPO*(尽管评估时不使用技能上下文)。这表明hindsight技能蒸馏进策略比推理时作为额外上下文提供更有效。

发现3:自演化hindsight蒸馏强于静态自蒸馏。 在静态蒸馏基线中,SEED在12个聚合比较中的10个取得最佳或并列最佳。优势在ALFWorld最明显:SEED比最强静态基线(SDAR)高出7.4点(3B)、10.2点(7B)、38.1点(1.7B)。这一模式支持将分析器与最新策略同步的好处——hindsight监督适应训练中遇到的轨迹和失败模式。

🔬训练动态、样本效率与跨域泛化

6.1 训练动态(Figure 3)

在ALFWorld上比较SEED和GRPO(Qwen2.5-3B):成功率曲线早期分化——训练步40时SEED达到约57%而GRPO仍在35%附近,优势此后持续。SEED还更快地减少平均episode长度,从约28步降至13步,而GRPO训练结束时约16步。更短轨迹伴随更高成功率,反映更高效的任务执行而非过早终止。

6.2 样本效率(Figure 4)

SEED在所有数据比例上持续超越GRPO,并能匹配或超越用更多数据训练的GRPO:

这证明SEED从每条完成轨迹中提取比仅基于终端奖励的RL更具信息量和更有效的监督。

6.3 跨域泛化(Figure 5)

在ALFWorld unseen split上评估3B检查点:SEED将宏平均成功率从70.9提升到86.2,超过GRPO 15.3点,在6个任务族中的5个取得更好性能。最大改进在Heat (+35.0)、Look (+18.3)、Pick (+16.5)。这表明SEED训练的策略获得了可迁移到未见环境的可复用行为策略,而非仅仅记忆训练轨迹。

👁️多模态扩展与消融研究

7.1 多模态扩展(Table 8, Appendix C.3)

为检验SEED是否扩展到纯文本交互之外,评估Qwen2.5-VL-3B-Instruct在两个视觉智能体基准上:

方法 Sokoban [6×6] ↑ EZPoints ↑ Average ↑
ReAct11.73.17.4
GRPO67.186.977.0
SEED82.0100.091.0
Δ+14.9+13.1+14.0

SEED在空间规划和视觉算术上的一致增益表明,它能将多模态轨迹转化为有用的hindsight监督,并通过自演化OPD内化该指导——评估时无需技能提示。

7.2 消融研究(Table 2)

在ALFWorld上(Qwen2.5-3B)评估三个核心组件的贡献:

方法 ALFWorld Avg Δ
SEED (完整)91.8
w/o Hindsight Skill SFT86.0−5.8
w/o Self-Evolving OPD87.0−4.8
w/o On-Policy Skill84.4−7.4

7.3 定性分析(Figure 6)

任务"put a candle in toilet"的对比:GRPO训练的智能体在定位蜡烛前先搜索目标容器,拿取无关卫生纸,进入离题循环,30步内从未找到或拾取蜡烛。SEED训练的智能体系统检查合理货架,在第2个货架找到蜡烛,5步完成正确放置。SEED展现的更直接轨迹与其更强性能和更高交互效率一致。

📐理论分析:占用匹配的自适应目标

论文附录A提供了SEED的理论分析,揭示了OPD信号的深层结构。

8.1 命题1:占用匹配的hindsight目标

定义条件期望门 wk(c,v) = E[gk(C,Y,S) | C=c, Y=v],归一化常数 Zk(c) = Σv πk(v|c)wk(c,v),技能重加权目标 rk(v|c) = πk(v|c)wk(c,v) / Zk(c)。则在更新初始化时:

θLopd,k(θ)|θ=θk = Ec~dk[ Zk(c) · ∇θDKL(rk(·|c) ∥ πθ(·|c))|θ=θk ]

OPD更新是向当前策略自身token-上下文占用上的技能重加权目标蒸馏的蒙特卡洛估计。因子 dk(c) 使监督占用匹配——聚焦于当前策略实际访问的上下文、动作和失败模式。在每个这样的上下文中,wk(c,v) 使监督技能选择性——更受轨迹特定hindsight技能支持的动作获得更大相对质量。

分布失配界

若用早期分布 μj 的样本替代当前在线策略样本 μk,辅助方向偏差以总变差为上界:

‖Ex~μk[ϕ] − Ex~μj[ϕ]‖2 ≤ 2G·TV(μk, μj) ≤ G·√(2DKLk∥μj))

在线策略收集在rollout阶段将此数据分布失配设为零——这是SEED要求on-policy的理论依据

值解释

当hindsight支持与当前策略动作值正相关时,重加权目标比未加权策略有更高局部期望值:

Ev~rk[Qk(c,v)] − Ev~πk[Qk(c,v)] = Covv~πk(Qk(c,v), wk(c,v)) / Zk(c)

这明确了SEED假设什么、不假设什么:SEED将hindsight支持转化为在线策略目标,而经验收益取决于生成的技能是否为更好的决策分配更大支持。

8.2 命题2:奖励平局下的决策特定信号

当rollout组中每条轨迹结果相同时(Arl=0,clipped奖励驱动项梯度为零),OPD项仍可保持非退化。在更新初始化处:

∂Lopd,k,c / ∂z(v) = πk(v|c) · [Zk(c) − wk(c,v)]

这证明SEED的密集技能信用在奖励平局时仍提供决策特定梯度——这是仅基于结果的RL完全无法做到的。

🌍局限、未来方向与产业意义

9.1 诚实声明的局限

论文在附录E中诚实讨论了局限:

9.2 未来方向

9.3 产业意义

📄关键数据速览与总结

论文信息:

· Wu, J., Yang, S., Lu, Z., Zhang, F., Shen, Y., Feng, L., Luo, H., Lian, Z., Zhang, S., Wen, Z. & Tao, J. "SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning." arXiv:2607.14777v1, 16 Jul 2026.

· 单位:Tsinghua University / Zhejiang University / The Chinese University of Hong Kong / Nanyang Technological University / Tongji University

· 通讯:wu-jy23@mails.tsinghua.edu.cn;Project Leader: Jinyang Wu;*Equal Contribution: Wu & Yang

· 代码:jinyangwu/SEED

核心数据速览:

· 骨干模型:Qwen2.5-3B/7B-Instruct、Qwen3-1.7B-Instruct、Qwen2.5-VL-3B-Instruct

· SFT:180任务 × 8 rollout = 1440轨迹;GLM-5.2外部分析器;3 epochs

· RL:150次策略更新;batch 16/128;rollout组N=8

· ALFWorld最佳:96.1%(Qwen2.5-7B),92.0%(Qwen3-1.7B),91.8%(Qwen2.5-3B)

· Search-QA最佳:48.6%(7B),45.7%(3B),42.2%(1.7B)

· WebShop最佳:89.7 Score / 78.9 Succ.(3B)

· 视觉任务:Sokoban 82.0%,EZPoints 100.0%,平均91.0%(+14.0 over GRPO)

· 样本效率:60%数据 → 80.7 > 全量GRPO 75.0

· 跨域泛化:ALFWorld Unseen 86.2 vs GRPO 70.9(+15.3)

· 消融最大影响:移除on-policy skill → −7.4点(最关键组件)

三个核心组件:

· 1. Hindsight Skill SFT(让策略学会分析轨迹生成技能)

· 2. Self-Evolving OPD(当前策略同时做actor和analyzer,共同进化)

· 3. On-Policy Skill(从当前策略自身轨迹导出技能,而非静态离线库)

核心洞察:

· 已完成轨迹揭示在线决策时不可获得的hindsight

· hindsight监督应 on-policy / dense / self-evolving

· 当前策略同时担任actor和analyzer → 决策与技能分析共同进化

· 技能仅训练时使用,推理时移除analyzer → 零部署开销

· OPD信号 = 技能诱导概率偏移 → 置信门控 → 密集token级蒸馏

理论保证:

· 命题1:OPD更新是占用匹配的技能重加权目标蒸馏的蒙特卡洛估计

· 分布失配界:在线策略收集将数据分布失配设为零

· 命题2:奖励平局时OPD仍提供决策特定梯度(仅基于结果的RL完全无法做到)

诚实声明:

· 本报告所有数值均来自论文原文(Table 1-2, 8, Figure 3-5),已逐项核对

· 论文诚实声明自演化风险:actor和analyzer共享盲点,不准确分析可能强化策略错误

· 置信门控和自判断不保证语义正确性

· 训练成本随交互长度和多模态上下文增长(部署零开销)