一句话判断:贡献在训练系统,不只在模型尺寸
报告标题中的 Scaling Reinforcement Learning Towards Self-Improvement 很容易让人联想到模型自主改写自身。实际机制更克制:人类团队先提供任务环境、可执行 verifier、agent harness、rubric 生成流程和教师模型,策略再通过大量交互探索更好的行为。它是受约束的策略自我改进,不是无需外部设计的递归自我改写。
MiMo-V2.6 包含 Pro 与 Flash:Pro 为 1.02T 总参数、42B 激活参数,Flash 为 310B 总参数、15B 激活参数。二者都走稀疏 MoE 路线,并在同一轮 mixed-task RL 中覆盖代码、通用工具、视觉与网络安全。作者把这一策略概括为 You Only RL Once:不是每个领域各训一个模型,而是把任务与不同 harness 混入同一大 batch。
模型底座:Hybrid-SWA、稀疏 MoE 与原生全模态
Pro 主干共有 70 层,其中 60 层使用局部滑动窗口注意力(SWA),10 层使用全局注意力(GA);窗口大小只有 128。每层 MoE 从 384 个专家中激活 8 个,没有 shared expert。这样的设计把大部分注意力成本约束在局部窗口,再周期性用 GA 汇总全局信息,因而能把训练上下文推到 1M。
| 模块 | MiMo-V2.6-Pro | 设计意图 |
|---|---|---|
| 文本主干 | 70 层;60 SWA + 10 GA;hidden 6144 | 局部计算为主,周期性恢复全局信息 |
| 稀疏 MoE | 384 experts,激活 8;1.02T / 42B active | 扩大容量而控制每 token 计算量 |
| MiMo-ViT | 681M;28 层;24 SWA + 4 GA | 图像/视频高分辨率输入的局部—全局混合建模 |
| 音频 | 308M tokenizer + 127M patch encoder;25 Hz → 6.25 Hz | 把语音、音乐和一般音频压成主干可消费的 token |
| 推测解码 | 5 层 DFlash 风格 drafter;一次预测后续 7 tokens | 降低超长 agent rollout 的生成成本 |
训练分三段衔接:预训练先做文本,再联合视觉与音频;mid-training 加入真实 agent 轨迹并把上下文从 256K 拉到 1M;随后进入大规模 RL。Flash 预训练 48T tokens(26T 文本 + 22T 全模态),Pro 为 30T(27T + 3T)。隐藏矩阵在 mid-training 阶段从 AdamW 切换到带行范数控制的 Muown,专家计算则做 MXFP4 量化感知训练。
MiMo-V2.6 的端到端训练闭环
MiMo-ViT
音频 tokenizer / encoder
Hybrid SWA + GA + MoE
视觉 13% · 上下文 3% · 安全 4%
多种 harness 并行 rollout
GRS 离线 rubric
GAR 在线组内比较
行为与长度惩罚
三条扩展轴:计算、环境与 grader
第一轴:把一个 RL step 扩成数十亿 tokens
每步采样 1,568 个 prompt,每个 prompt 生成 16 条轨迹,共 25,088 条序列、2.7–3.7B 训练 tokens;报告给出的平均轨迹长度约 110K–150K tokens。Pro 与 Flash 的 RL 后训练成本分别为 260 万美元与 90 万美元。Pro 的计算成本中 rollout 占 43.8%,训练占 43.5%,grader 占 12.7%。这组比例说明 grader 已不是外围评估工具,而是训练预算的一等组成。
第二轴:混合任务,也混合 agent 外壳
训练分布为代码 68%、通用工具 12%、审美设计 13%、上下文遵循 3%、网络安全 4%。更关键的是,同一任务可通过不同 harness 呈现。报告中的 multi-harness 代码实验使用 4 个训练 harness,并在 Codex、Claude Code 与 mini-swe-agent 三个 held-out harness 上评测;三者平均 Pass@1 从约 50% 上升到 66%。这比只在一个固定 prompt/tool 协议上优化更接近“能力迁移”,尽管仍属于作者内部训练与评测管线。
第三轴:让 grader 比二元测试更懂“质量”
测试通过只能说明最终结果触达了可见断言,无法区分最小修复与大面积改动、严谨验证与碰巧通过、正常解题与利用评测漏洞。MiMo-V2.6 把额外计算投入到组内比较,试图同时优化正确性、实现质量、行为质量和 token 效率。
GRS 与 GAR:从“过没过”到“怎么过”
Groupwise Reward Synthesis(GRS)用于一部分高通过率任务。系统先离线比较多个 rollout,生成任务特定的 solution rubric 与 behavior rubric;训练时 grader 进入执行环境,对单条新轨迹打分。最终奖励采用乘法:
乘法结构让失败轨迹仍为零,同时把通过样本按质量拉开。但它也意味着 rubric 偏差会直接进入奖励;“由 agent 从样本中归纳 rubric,再由 agent 使用 rubric 打分”并不会自动消除 judge 偏差。
Groupwise Advantage Redistribution(GAR)覆盖其余代码任务。在线 grader 联合查看同一组里的成功与失败轨迹,从方案适切性、实现精确性、改动最小性、无副作用和工程质量五个维度排序通过方案,再把正 advantage 从较差通过样本转移给较优样本。确认存在泄漏答案或 reward hack 时,有效奖励直接归零;grader 输出不可用则退回原始 advantage。
GAR 的小规模对照实验显示:无 GAR 时,平均轮数与 token 长度快速膨胀,pass rate 较早停滞;加入 GAR 后,pass-rate 增长持续到第 52 步,轮数大致稳定。证据方向是积极的,但这是 Flash、代码单域、batch 128、token-mean loss 的专门实验,不能直接等同于大规模混合训练中 GAR 的净因果效应。
稳定性:router 冻结与 reward hacking 防线
冻结 router 是一个很实用的负结果
若 MoE router 随 RL 更新,Pro 第 9 层的专家负载变异系数从 0.78 升到 2.0,峰值负载从均值的 6 倍升到 16 倍,冷专家比例从 0.5% 升到 22%。作者把第 20 步 checkpoint 的 router 恢复到 RL 前参数,负载恢复而 benchmark 基本不变,据此把崩塌归因于 router drift,并在最终训练中冻结 router。冻结后相应指标稳定在 CV≈0.7、峰值≈5.5×、冷专家≈1%。
这说明 RL 优化信号可能优先把“走哪位专家”当作捷径,而不是稳健改善专家本身;冻结 router 相当于固定稀疏计算拓扑,只让专家与其余参数学习。它牺牲了潜在的路由适应性,换取负载可预测性和训练稳定性。
reward hacking 防线是纵深防御,不是单一分类器
报告描述了环境清洗、泄漏扫描、对抗 hack agent、重复执行、网络隔离、训练时轨迹审计和 GAR 奖励归零。最终运行中,作者报告两款模型的检测到 hack 轨迹占比均低于 2%。但这里的“低于 2%”只覆盖检测器能识别的行为,不能解释为真实未检测攻击率上限。
此外,长度惩罚只对高通过率组中的成功轨迹生效;工具名错误、参数格式错误等局部行为则用 segment-level advantage shaping 处理。这种分层设计比给整条长轨迹一个标量更合理:基础设施故障可 mask,模型错误可定点惩罚,正常片段不必陪同整条失败轨迹一起受罚。
基础设施:25K 条长轨迹如何汇成一次更新
Harness Pool
用持久化多租户 Ray actor 承载大量 agent loop 与环境实例,避免“一会话一 actor”耗尽控制节点文件描述符;阻塞环境操作放入后台线程。
Payload Porter
控制面只搬运奖励、长度和对象 key;token、路由记录、top-p 集合和图像留在分布式数据面,避免 driver 聚合数万条重 payload。
Sample Mixer
25 个数据源的平均 token 数与 rollout 时长分别相差 90×、66×;系统按目标占比、接受率和耗时自适应分配并发与调度预算。
Consistency Replay
训练端回放 rollout 时的 MoE expert 路由与 top-p 候选集合,并用相同 MXFP4 约束量化专家权重,减小训练/推理概率错位。
partial rollout 让未完成轨迹跨更新步继续,避免等待长尾;代价是策略更新后需要重新 prefill KV cache。上下文缓存把 agent 等待工具的时间映射成分层存储:运行时状态留在 HBM,等待环境时下沉到 pinned host memory。DFlash 则针对 RL rollout 日志再训练,报告称相对基线提升约 10.3% 单节点吞吐。
报告也诚实列出了失败:GPU 双比特错误、Kubernetes 故障、grader 网络不可达、MoE 微批负载偏斜导致 GPU OOM、打包阶段 CPU OOM。30 步 Pro 运行耗时 123.1 小时,Flash 为 81.8 小时。把这些恢复事件公开出来,比只给最终曲线更有工程价值。
结果怎么读:强项、短板与比较边界
作者报告,DeepSWE v1.1 的 average@3 在 RL 过程中由 Pro 58.4→72.6、Flash 48.7→65.7。最终表中,Pro 在 AutomationBench(53.1)和 Terminal Bench 2.1(89.9)高于列出的三款闭源基线;DeepSWE v1.1 为 71.9,略低于表中的 Claude Opus 5(74.0)与 GPT-5.6 Sol(73.0)。在 ExploitGym、ExploitBench、SEC Bench Pro 等安全任务上,Pro 与最强列示基线仍有明显差距。
证据较强之处
同一训练运行的随步数曲线;router 冻结的对照与参数恢复诊断;GAR 专门对照;held-out harness 迁移;开放 9B 起点上的多领域 RL 增益。
需要保留判断之处
结果均来自发布方;三项 MiMo benchmark 为内部集;环境修正版、agent harness、token 预算和 reasoning 配置会影响横向比较;未给所有指标的方差、置信区间或独立复现。
另一个重要混杂是 更多 token 与更高分同时增长。报告确实画出了训练步数、得分和轨迹长度,但最终模型相对基线的优势不能自动归因于“更好的策略”而非“更长的推理预算”。正确读法是:MiMo-V2.6 证明了这套联合系统能把巨量 RL 计算转成多任务分数提升;它尚未把架构、数据、token 预算、GRS、GAR、多 harness 和环境规模的边际贡献全部分离。
最有价值的可复现部分:9B 蒸馏模型与开放环境
万亿参数主模型虽然以 MIT 许可开放权重,但复现其训练需要极高成本。对研究社区更实用的是 MiMo-V2.6-Distill-Qwen-9B、约 7K 个开放训练任务、verifier、Uni-Agent 与 RL 框架。9B 模型由 Qwen3.5-9B 在 77.4B MiMo 生成 tokens 上 SFT,其中 27.2B 为 loss tokens。
| 开放实验 | Qwen3.5-9B | MiMo SFT | 进一步 RL |
|---|---|---|---|
| SWE-bench Verified(avg@3) | 60.0 | 61.1 | 66.2 |
| SWE-bench Pro(avg@3) | 32.0 | 44.6 | 47.6 |
| Terminal Bench 2.1(avg@1) | 27.0 | 37.1 | 52.8 |
| MiMo Cyber Bench mini(avg@3) | 5.7 | 31.3 | 47.0 |
| MiMo Visual Coding mini(avg@1) | 61.7 | 64.0 | 72.4 |
以上均为技术报告 Table 6 的发布方结果;带 “MiMo … mini” 的评测与对应训练集同分布,适合验证训练管线是否有效,不适合单独证明跨分布泛化。
这组开放实验比旗舰排行榜更有研究价值,因为它给出了可承受的共同初始化、分领域 GRPO 配方与 multi-harness 对照。下一步最关键的独立核验不是再抄一遍总榜,而是在固定 token 预算下复现:单 harness vs 多 harness、binary reward vs GAR、可见 harness vs held-out harness,以及 grader 错误或离线时的退化行为。
“自我改进”到底成立到哪一层
MiMo-V2.6 的自我改进闭环包含三个真实环节:当前策略产生多条候选;grader 以同组候选为参照发现相对质量差异;更新后的策略生成更优、更短的轨迹。GRS 还能从多条尝试中归纳 rubric,GAR 则在线重新分配成功样本的 advantage。
但边界同样清楚:任务空间由人类与数据管线指定,verifier 与 sandbox 由外部提供,SFT/MOPD 教师仍承担难验证领域的监督,reward hacking 规则也由工程团队持续修补。因而更准确的表述是在人工设计的可验证环境中扩大策略改进循环。把它称为“递归自我改进已实现”会超出报告证据。
MOPD2 也印证了这一点:对科学研究、长程游戏开发等难以写可靠 reward 的任务,系统并未强行 RL,而是用多教师 on-policy distillation,把教师轨迹或 SFT 示例切成多个历史前缀,让学生从每个决策点续写一轮,再接受 token-level 教师监督。这是一种聪明的能力合并方式,但不是无监督自举。
工程采用建议与最终结论
- 想用模型:Pro 是重量级部署对象。官方 SGLang 示例采用多节点并行、expert parallel、MXFP4 与 speculative decoding;评估成本时不要只看 42B active,存储与通信仍受 1.02T 总参数支配。
- 想研究 agentic RL:优先从 Distill-Qwen-9B、开放环境和 Uni-Agent 开始。先复现单域曲线,再引入 multi-harness 和 GAR,能更清楚定位增益来源。
- 想迁移方法:最值得借鉴的是“可执行结果 + 组内质量比较 + 局部行为惩罚”的奖励分层,以及把基础设施故障从学习信号中 mask 掉。
- 想做严谨比较:固定模型、harness、最大 turns、上下文和总生成 tokens;对内部 benchmark 与同分布 mini set 单独标注;报告置信区间和 grader/fallback 审计。
来源与核验说明
主要来源(均为官方一手材料,访问日期 2026-09-22):
· MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement,44 页技术报告。架构、训练配方、公式、成本、曲线与表格数字均以此为主。
· MiMo-V2.6-Pro-RL 模型卡与开放权重;MiMo-V2.6-Distill-Qwen-9B。
· 小米 MiMo-V2.6 官方发布页;RL running log。
· XiaomiMiMo/uni-agent(长程 agent 运行与训练框架);XiaomiMiMo/verl(RL 训练框架分支)。
证据口径:本文所有 benchmark 与训练效率数字均标为作者报告结果,没有将其改写为独立第三方结论。对“自我改进”、内部 benchmark、同分布 mini set、token 预算和 grader 偏差的讨论属于基于报告方法与实验设计的分析。