# 大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端 - Sohu

*Источник: Sohu*
*Дата: 2026-09-18*
*Язык: zh*

**Кратко:** 大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端
- 标题：Trust Region On-Policy Distillation
- 文章地址：https://arxiv.org/abs/2606.01249
- 项目地址：https://github.com/Xingrun-Xing2/TrOPD
GPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。
对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。
On-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。
针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。
核心结论
当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：
不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。
沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。
图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。
问题：K1 估计器的两个优化瓶颈
要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。
全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。
为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：
这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。
瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励
这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？
现状综述：主流方法都在改什么
面对这两个瓶颈，现有工作大致沿两条思路修补。
思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。
这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。
诊断实验：先把 OPD 问题找出来
把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：
表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。
三个现象，和上一节的理论推演对照着看，很能说明问题：
1. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。
3.

大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端
- 标题：Trust Region On-Policy Distillation
- 文章地址：https://arxiv.org/abs/2606.01249
- 项目地址：https://github.com/Xingrun-Xing2/TrOPD
GPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。
对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。
On-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。
针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。
核心结论
当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：
不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。
沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。
图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。
问题：K1 估计器的两个优化瓶颈
要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。
全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。
为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：
这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。
瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励
这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？
现状综述：主流方法都在改什么
面对这两个瓶颈，现有工作大致沿两条思路修补。
思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。
这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。
诊断实验：先把 OPD 问题找出来
把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：
表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。
三个现象，和上一节的理论推演对照着看，很能说明问题：
1. 单独用 top-k 估计的 FKL，训练几乎直接失败。这印证了 top-k 截断 FKL 从教师的概率角度进行估计，依然存在较大的偏差。
2. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。
3. 奖励裁剪确实有效果，但依赖超参数。 Clip Outlier（47.86）和 Mask Outlier（47.72）都比 OPD 基线高出约 1 个点，说明 “抑制离群梯度” 方向是对的。但阈值 τ 需要人工固定设定，没办法随训练进程自适应。
三条现象放在一起，指向同一个结论：
换散度公式，或按熵筛选 token，都没有真正触及问题的根子。判断一个 token 的监督信号是否可靠，不能只看散度公式或熵这类和 “教师是否认可” 无关的指标，而应直接衡量教师和学生在这个 token 上的分歧程度本身。裁剪 / 屏蔽已经摸到了正确方向的边（用奖励大小去筛选），值得进一步探索。
核心方法：基于信任域的 OPD
问题出在离群 token 的梯度失真，TrOPD 的思路很直接：借鉴强化学习里的信任域策略优化（TRPO），只在教师信得过的区域做常规的在策略学习，离群区域换一套更保守的监督。
图 2：TrOPD 总览。学生生成的 token 按教师是否 “认可” 分为信任域和离群区域，分别使用不同的散度估计；同时引入离策略引导，让学生从教师给出的前缀续写。
给定信任域掩码 M（等于 1 表示这个 token 落在信任域内，等于 0 表示离群），单个 token 的训练目标写成：
也就是信任域内继续用原来的 K1 反向 KL，离群区域换成基于教师 top-k 词表的前向 KL。
这个设计在训练曲线上的效果非常直观：
图 3：相比原始 OPD 和 Clip Outlier，屏蔽离群点（Mask Outlier）训练过程中策略熵更高（探索能力保留更好）、梯度范数更低更稳（优化更平稳）。
OPD 和 Clip Outlier 的策略熵在训练开始后几十步内就从接近 1.0 断崖式下跌到 0.2~0.3，Mask Outlier 的熵则稳定在 0.5 左右；梯度范数走势一致，OPD 持续更高，Clip、Mask Outlier 很快收敛到接近 0。这说明 “裁剪 / 屏蔽能涨分” 的底层机制是减少了破坏性更新，TrOPD 的信任域机制则把这个 “临时补丁” 变成了有理论依据、能自适应的判据。
续写接着教师语境往下写，后续 token 落入信任域的概率随之提高，不再是被动等离群 token 出现再补救，而是主动引导学生的探索方向。教师前缀长度 l 训练初期设为最大训练长度，之后按余弦调度退火到 0，学生独立生成比例逐步提高，直到完全变成纯粹的在策略生成，这样训练初期就避开了 “学生自由生成、信任域内所剩无几” 的高风险阶段，再逐步放手交给信任域机制自我调节。
把信任域内的反向 KL、离群区域的前向 KL、离策略引导的前向 KL 合到一起，就是 TrOPD 完整的目标函数：
实验结果
在单领域（仅数学）和多领域（数学 + 代码 + 科学）两种场景下，分别用 DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen3-SFT-1.7B 作学生模型做了系统评测。
表 3：单领域中，TrOPD 相比 OPD 在数学推理上平均提升 +3.06 分，域外任务上提升 +2.63 分；相比同样做了离群点修正的 REOPOLD 仍高出 1.99~1.84 分。多领域下，TrOPD 相比 OPD 提升达 +4.62 分。
表 4：换成更强的 Qwen3-SFT-1.7B 学生模型和 Qwen3-Nemotron-4B 教师模型，多领域下 TrOPD 相比 OPD 平均提升 +3.44 分，AIME 2024 从 48.02 提升到 52.08，IFBench 从 37.07 提升到 42.18。
这些数字里，有两个规律值得多说两句。
第一，TrOPD 的提升不只发生在训练过的领域内。 单领域只用数学题训练，但额外评测了域外（OOD）任务：TrOPD 相比 OPD 在训练过的数学推理上平均提升 +3.06 分，在完全没训练过的代码生成和 STEM 任务上提升幅度反而更大，达到 +2.63 分。模型压根没在这些任务上做过在策略训练，这个提升只能来自更本质的原因：信任域机制让教师监督信号被更可靠地利用，这种优化质量的提升自然会泛化到其他任务。
第二，教师和学生差得越远的场景，TrOPD 的优势反而越大。 把同一个学生模型放到单领域和多领域（数学 + 代码 + 科学）两种设置下比较：OPD 基线平均分从单领域的 37.11 掉到多领域的 32.99，跌了 4.12 分，任务越杂越难顶住；而 TrOPD 从 40.63 掉到 37.61，只跌了 3.02 分，相对优势反而从 +3.52 分扩大到 +4.62 分。这与信任域机制的设计初衷一致：教师、学生分布差距越大，越需要一套能自适应处理离群点的机制。
结论与展望
TrOPD 的意义，在于把在 OPD 的关注点从散度形式的选择，转向监督信号本身的可靠性。信任域以教师与学生的分歧程度为判据，自适应调整学生模型的学习方式，为 OPD 建立了一套有理论依据的稳定机制。教师与学生的能力差距越大，这一机制的收益越为显著，而这正是端侧部署的常态：在受限的参数与算力预算下，仍要求小模型尽可能完整地承接大模型的推理能力。随着端侧智能向更多设备与场景延伸，进一步提升监督信号的可靠性，将持续决定端侧 AI 能力的上限。
作者信息
本文第一作者为邢兴润博士，现任三星大模型团队研究员。他博士毕业于中国科学院自动化研究所，曾在北京智源人工智能研究院等机构开展研究工作，长期专注于大模型强化学习、高效推理等方向。
本文通讯作者为唐业辉博士。公开资料显示，他现任三星大模型团队负责人、高级技术总监。作为全球规模最大的科技企业之一，三星拥有庞大的研发体系，而 “95 后” 的唐业辉已成为其最年轻的部门负责人，主导大模型训练及核心技术研发。他博士毕业于北京大学，曾入选 “天才少年” 计划，其研究成果在 Google Scholar 上累计引用超过 1.4 万次，并长期担任 NeurIPS、ICML、ICLR 等国际顶级 AI 会议领域主席（Area Chair）。

[Оригинал](https://m.sohu.com/a/1077764200_129720?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334)