🎯一句话判断:贡献在训练系统,不只在模型尺寸

核心判断:MiMo-V2.6 最重要的不是“又一个万亿参数 MoE”,而是展示了一套可运行的规模化 agentic RL 配方:用一次混合任务训练同时扩展 rollout、环境、harness 和 grader,再用路由冻结、轨迹调度、奖励塑形与执行一致性把系统稳住。

报告标题中的 Scaling Reinforcement Learning Towards Self-Improvement 很容易让人联想到模型自主改写自身。实际机制更克制:人类团队先提供任务环境、可执行 verifier、agent harness、rubric 生成流程和教师模型,策略再通过大量交互探索更好的行为。它是受约束的策略自我改进,不是无需外部设计的递归自我改写。

1.02T / 42BPro 总参数 / 单 token 激活参数
1Mmid-training 与 RL 支持的上下文长度
25,088每步 1,568 prompts × 16 rollouts
2.7–3.7B每个 RL 更新步的训练 tokens

MiMo-V2.6 包含 Pro 与 Flash:Pro 为 1.02T 总参数、42B 激活参数,Flash 为 310B 总参数、15B 激活参数。二者都走稀疏 MoE 路线,并在同一轮 mixed-task RL 中覆盖代码、通用工具、视觉与网络安全。作者把这一策略概括为 You Only RL Once:不是每个领域各训一个模型,而是把任务与不同 harness 混入同一大 batch。

🏗️模型底座:Hybrid-SWA、稀疏 MoE 与原生全模态

Pro 主干共有 70 层,其中 60 层使用局部滑动窗口注意力(SWA),10 层使用全局注意力(GA);窗口大小只有 128。每层 MoE 从 384 个专家中激活 8 个,没有 shared expert。这样的设计把大部分注意力成本约束在局部窗口,再周期性用 GA 汇总全局信息,因而能把训练上下文推到 1M。

模块MiMo-V2.6-Pro设计意图
文本主干70 层;60 SWA + 10 GA;hidden 6144局部计算为主,周期性恢复全局信息
稀疏 MoE384 experts,激活 8;1.02T / 42B active扩大容量而控制每 token 计算量
MiMo-ViT681M;28 层;24 SWA + 4 GA图像/视频高分辨率输入的局部—全局混合建模
音频308M tokenizer + 127M patch encoder;25 Hz → 6.25 Hz把语音、音乐和一般音频压成主干可消费的 token
推测解码5 层 DFlash 风格 drafter;一次预测后续 7 tokens降低超长 agent rollout 的生成成本

训练分三段衔接:预训练先做文本,再联合视觉与音频;mid-training 加入真实 agent 轨迹并把上下文从 256K 拉到 1M;随后进入大规模 RL。Flash 预训练 48T tokens(26T 文本 + 22T 全模态),Pro 为 30T(27T + 3T)。隐藏矩阵在 mid-training 阶段从 AdamW 切换到带行范数控制的 Muown,专家计算则做 MXFP4 量化感知训练。

📈三条扩展轴:计算、环境与 grader

第一轴:把一个 RL step 扩成数十亿 tokens

每步采样 1,568 个 prompt,每个 prompt 生成 16 条轨迹,共 25,088 条序列、2.7–3.7B 训练 tokens;报告给出的平均轨迹长度约 110K–150K tokens。Pro 与 Flash 的 RL 后训练成本分别为 260 万美元与 90 万美元。Pro 的计算成本中 rollout 占 43.8%,训练占 43.5%,grader 占 12.7%。这组比例说明 grader 已不是外围评估工具,而是训练预算的一等组成。

第二轴:混合任务,也混合 agent 外壳

训练分布为代码 68%、通用工具 12%、审美设计 13%、上下文遵循 3%、网络安全 4%。更关键的是,同一任务可通过不同 harness 呈现。报告中的 multi-harness 代码实验使用 4 个训练 harness,并在 Codex、Claude Code 与 mini-swe-agent 三个 held-out harness 上评测;三者平均 Pass@1 从约 50% 上升到 66%。这比只在一个固定 prompt/tool 协议上优化更接近“能力迁移”,尽管仍属于作者内部训练与评测管线。

第三轴:让 grader 比二元测试更懂“质量”

测试通过只能说明最终结果触达了可见断言,无法区分最小修复与大面积改动、严谨验证与碰巧通过、正常解题与利用评测漏洞。MiMo-V2.6 把额外计算投入到组内比较,试图同时优化正确性、实现质量、行为质量和 token 效率。

⚖️GRS 与 GAR:从“过没过”到“怎么过”

Groupwise Reward Synthesis(GRS)用于一部分高通过率任务。系统先离线比较多个 rollout,生成任务特定的 solution rubric 与 behavior rubric;训练时 grader 进入执行环境,对单条新轨迹打分。最终奖励采用乘法:

Ri = Ritest × Sisolution × Sibehavior

乘法结构让失败轨迹仍为零,同时把通过样本按质量拉开。但它也意味着 rubric 偏差会直接进入奖励;“由 agent 从样本中归纳 rubric,再由 agent 使用 rubric 打分”并不会自动消除 judge 偏差。

Groupwise Advantage Redistribution(GAR)覆盖其余代码任务。在线 grader 联合查看同一组里的成功与失败轨迹,从方案适切性、实现精确性、改动最小性、无副作用和工程质量五个维度排序通过方案,再把正 advantage 从较差通过样本转移给较优样本。确认存在泄漏答案或 reward hack 时,有效奖励直接归零;grader 输出不可用则退回原始 advantage。

GAR 的小规模对照实验显示:无 GAR 时,平均轮数与 token 长度快速膨胀,pass rate 较早停滞;加入 GAR 后,pass-rate 增长持续到第 52 步,轮数大致稳定。证据方向是积极的,但这是 Flash、代码单域、batch 128、token-mean loss 的专门实验,不能直接等同于大规模混合训练中 GAR 的净因果效应。

🛡️稳定性:router 冻结与 reward hacking 防线

冻结 router 是一个很实用的负结果

若 MoE router 随 RL 更新,Pro 第 9 层的专家负载变异系数从 0.78 升到 2.0,峰值负载从均值的 6 倍升到 16 倍,冷专家比例从 0.5% 升到 22%。作者把第 20 步 checkpoint 的 router 恢复到 RL 前参数,负载恢复而 benchmark 基本不变,据此把崩塌归因于 router drift,并在最终训练中冻结 router。冻结后相应指标稳定在 CV≈0.7、峰值≈5.5×、冷专家≈1%。

这说明 RL 优化信号可能优先把“走哪位专家”当作捷径,而不是稳健改善专家本身;冻结 router 相当于固定稀疏计算拓扑,只让专家与其余参数学习。它牺牲了潜在的路由适应性,换取负载可预测性和训练稳定性。

reward hacking 防线是纵深防御,不是单一分类器

报告描述了环境清洗、泄漏扫描、对抗 hack agent、重复执行、网络隔离、训练时轨迹审计和 GAR 奖励归零。最终运行中,作者报告两款模型的检测到 hack 轨迹占比均低于 2%。但这里的“低于 2%”只覆盖检测器能识别的行为,不能解释为真实未检测攻击率上限。

此外,长度惩罚只对高通过率组中的成功轨迹生效;工具名错误、参数格式错误等局部行为则用 segment-level advantage shaping 处理。这种分层设计比给整条长轨迹一个标量更合理:基础设施故障可 mask,模型错误可定点惩罚,正常片段不必陪同整条失败轨迹一起受罚。

🧰基础设施:25K 条长轨迹如何汇成一次更新

Harness Pool

用持久化多租户 Ray actor 承载大量 agent loop 与环境实例,避免“一会话一 actor”耗尽控制节点文件描述符;阻塞环境操作放入后台线程。

Payload Porter

控制面只搬运奖励、长度和对象 key;token、路由记录、top-p 集合和图像留在分布式数据面,避免 driver 聚合数万条重 payload。

Sample Mixer

25 个数据源的平均 token 数与 rollout 时长分别相差 90×、66×;系统按目标占比、接受率和耗时自适应分配并发与调度预算。

Consistency Replay

训练端回放 rollout 时的 MoE expert 路由与 top-p 候选集合,并用相同 MXFP4 约束量化专家权重,减小训练/推理概率错位。

partial rollout 让未完成轨迹跨更新步继续,避免等待长尾;代价是策略更新后需要重新 prefill KV cache。上下文缓存把 agent 等待工具的时间映射成分层存储:运行时状态留在 HBM,等待环境时下沉到 pinned host memory。DFlash 则针对 RL rollout 日志再训练,报告称相对基线提升约 10.3% 单节点吞吐。

报告也诚实列出了失败:GPU 双比特错误、Kubernetes 故障、grader 网络不可达、MoE 微批负载偏斜导致 GPU OOM、打包阶段 CPU OOM。30 步 Pro 运行耗时 123.1 小时,Flash 为 81.8 小时。把这些恢复事件公开出来,比只给最终曲线更有工程价值。

📊结果怎么读:强项、短板与比较边界

作者报告,DeepSWE v1.1 的 average@3 在 RL 过程中由 Pro 58.4→72.6、Flash 48.7→65.7。最终表中,Pro 在 AutomationBench(53.1)和 Terminal Bench 2.1(89.9)高于列出的三款闭源基线;DeepSWE v1.1 为 71.9,略低于表中的 Claude Opus 5(74.0)与 GPT-5.6 Sol(73.0)。在 ExploitGym、ExploitBench、SEC Bench Pro 等安全任务上,Pro 与最强列示基线仍有明显差距。

证据较强之处

同一训练运行的随步数曲线;router 冻结的对照与参数恢复诊断;GAR 专门对照;held-out harness 迁移;开放 9B 起点上的多领域 RL 增益。

需要保留判断之处

结果均来自发布方;三项 MiMo benchmark 为内部集;环境修正版、agent harness、token 预算和 reasoning 配置会影响横向比较;未给所有指标的方差、置信区间或独立复现。

另一个重要混杂是 更多 token 与更高分同时增长。报告确实画出了训练步数、得分和轨迹长度,但最终模型相对基线的优势不能自动归因于“更好的策略”而非“更长的推理预算”。正确读法是:MiMo-V2.6 证明了这套联合系统能把巨量 RL 计算转成多任务分数提升;它尚未把架构、数据、token 预算、GRS、GAR、多 harness 和环境规模的边际贡献全部分离。

🔬最有价值的可复现部分:9B 蒸馏模型与开放环境

万亿参数主模型虽然以 MIT 许可开放权重,但复现其训练需要极高成本。对研究社区更实用的是 MiMo-V2.6-Distill-Qwen-9B、约 7K 个开放训练任务、verifier、Uni-Agent 与 RL 框架。9B 模型由 Qwen3.5-9B 在 77.4B MiMo 生成 tokens 上 SFT,其中 27.2B 为 loss tokens。

开放实验Qwen3.5-9BMiMo SFT进一步 RL
SWE-bench Verified(avg@3)60.061.166.2
SWE-bench Pro(avg@3)32.044.647.6
Terminal Bench 2.1(avg@1)27.037.152.8
MiMo Cyber Bench mini(avg@3)5.731.347.0
MiMo Visual Coding mini(avg@1)61.764.072.4

以上均为技术报告 Table 6 的发布方结果;带 “MiMo … mini” 的评测与对应训练集同分布,适合验证训练管线是否有效,不适合单独证明跨分布泛化。

这组开放实验比旗舰排行榜更有研究价值,因为它给出了可承受的共同初始化、分领域 GRPO 配方与 multi-harness 对照。下一步最关键的独立核验不是再抄一遍总榜,而是在固定 token 预算下复现:单 harness vs 多 harness、binary reward vs GAR、可见 harness vs held-out harness,以及 grader 错误或离线时的退化行为。

🧭“自我改进”到底成立到哪一层

MiMo-V2.6 的自我改进闭环包含三个真实环节:当前策略产生多条候选;grader 以同组候选为参照发现相对质量差异;更新后的策略生成更优、更短的轨迹。GRS 还能从多条尝试中归纳 rubric,GAR 则在线重新分配成功样本的 advantage。

但边界同样清楚:任务空间由人类与数据管线指定,verifier 与 sandbox 由外部提供,SFT/MOPD 教师仍承担难验证领域的监督,reward hacking 规则也由工程团队持续修补。因而更准确的表述是在人工设计的可验证环境中扩大策略改进循环。把它称为“递归自我改进已实现”会超出报告证据。

MOPD2 也印证了这一点:对科学研究、长程游戏开发等难以写可靠 reward 的任务,系统并未强行 RL,而是用多教师 on-policy distillation,把教师轨迹或 SFT 示例切成多个历史前缀,让学生从每个决策点续写一轮,再接受 token-level 教师监督。这是一种聪明的能力合并方式,但不是无监督自举。

🚀工程采用建议与最终结论

  1. 想用模型:Pro 是重量级部署对象。官方 SGLang 示例采用多节点并行、expert parallel、MXFP4 与 speculative decoding;评估成本时不要只看 42B active,存储与通信仍受 1.02T 总参数支配。
  2. 想研究 agentic RL:优先从 Distill-Qwen-9B、开放环境和 Uni-Agent 开始。先复现单域曲线,再引入 multi-harness 和 GAR,能更清楚定位增益来源。
  3. 想迁移方法:最值得借鉴的是“可执行结果 + 组内质量比较 + 局部行为惩罚”的奖励分层,以及把基础设施故障从学习信号中 mask 掉。
  4. 想做严谨比较:固定模型、harness、最大 turns、上下文和总生成 tokens;对内部 benchmark 与同分布 mini set 单独标注;报告置信区间和 grader/fallback 审计。
最终结论:MiMo-V2.6 是一份高价值的“如何把 agentic RL 做大并保持可训练”的系统报告。它对大 batch、长轨迹、混合环境、细粒度评分和 MoE 稳定性的组合回答相当完整;开放 9B 模型与环境也为独立复现提供了入口。它尚未证明自主递归自我改进,也没有完全排除内部评测、推理预算和 grader 偏差。把它当成一套强工程基线与研究议程,比把它当成 AGI 宣言更准确。

📚来源与核验说明

主要来源(均为官方一手材料,访问日期 2026-09-22):

· MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement,44 页技术报告。架构、训练配方、公式、成本、曲线与表格数字均以此为主。

· MiMo-V2.6-Pro-RL 模型卡与开放权重MiMo-V2.6-Distill-Qwen-9B

· 小米 MiMo-V2.6 官方发布页RL running log

· XiaomiMiMo/uni-agent(长程 agent 运行与训练框架);XiaomiMiMo/verl(RL 训练框架分支)。

证据口径:本文所有 benchmark 与训练效率数字均标为作者报告结果,没有将其改写为独立第三方结论。对“自我改进”、内部 benchmark、同分布 mini set、token 预算和 grader 偏差的讨论属于基于报告方法与实验设计的分析。