{"id":85047,"topic":"ai","source":"Sohu","title":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端 - Sohu","url":"https://m.sohu.com/a/1077764200_129720?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","url_hash":"7dd4b6388e971da0a7cfc6341ed71be9b424a451","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiiAFBVV95cUxOWWlhUk9IVXFMeS1MRmkxUUJyZHpRUEoxOW9IUjhrOUdpMnBKTEVFV0NnWDhwWklqZWkzT0hnS0MtbnZQVmhmb2l1eVUxYk9MUThWQW54TW9FVGpWRTJHWjJVa3prcWdaX0I2MmIzZi10NFNZd1piX3dJeDdiRDBzV2NGUnpmUUlY?oc=5\" target=\"_blank\">大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">Sohu</font>","content":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端\n- 标题：Trust Region On-Policy Distillation\n- 文章地址：https://arxiv.org/abs/2606.01249\n- 项目地址：https://github.com/Xingrun-Xing2/TrOPD\nGPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。\n对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。\nOn-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。\n针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。\n核心结论\n当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：\n不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。\n沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。\n图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。\n问题：K1 估计器的两个优化瓶颈\n要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。\n全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。\n为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：\n这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。\n瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励\n这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？\n现状综述：主流方法都在改什么\n面对这两个瓶颈，现有工作大致沿两条思路修补。\n思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。\n这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。\n诊断实验：先把 OPD 问题找出来\n把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：\n表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。\n三个现象，和上一节的理论推演对照着看，很能说明问题：\n1. 单独用 top-k 估计的 FKL，训练几乎直接失败。这印证了 top-k 截断 FKL 从教师的概率角度进行估计，依然存在较大的偏差。\n2. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。\n3. 奖励裁剪确实有效果，但依赖超参数。 Clip Outlier（47.86）和 Mask Outlier（47.72）都比 OPD 基线高出约 1 个点，说明 “抑制离群梯度” 方向是对的。但阈值 τ 需要人工固定设定，没办法随训练进程自适应。\n三条现象放在一起，指向同一个结论：\n换散度公式，或按熵筛选 token，都没有真正触及问题的根子。判断一个 token 的监督信号是否可靠，不能只看散度公式或熵这类和 “教师是否认可” 无关的指标，而应直接衡量教师和学生在这个 token 上的分歧程度本身。裁剪 / 屏蔽已经摸到了正确方向的边（用奖励大小去筛选），值得进一步探索。\n核心方法：基于信任域的 OPD\n问题出在离群 token 的梯度失真，TrOPD 的思路很直接：借鉴强化学习里的信任域策略优化（TRPO），只在教师信得过的区域做常规的在策略学习，离群区域换一套更保守的监督。\n图 2：TrOPD 总览。学生生成的 token 按教师是否 “认可” 分为信任域和离群区域，分别使用不同的散度估计；同时引入离策略引导，让学生从教师给出的前缀续写。\n给定信任域掩码 M（等于 1 表示这个 token 落在信任域内，等于 0 表示离群），单个 token 的训练目标写成：\n也就是信任域内继续用原来的 K1 反向 KL，离群区域换成基于教师 top-k 词表的前向 KL。\n这个设计在训练曲线上的效果非常直观：\n图 3：相比原始 OPD 和 Clip Outlier，屏蔽离群点（Mask Outlier）训练过程中策略熵更高（探索能力保留更好）、梯度范数更低更稳（优化更平稳）。\nOPD 和 Clip Outlier 的策略熵在训练开始后几十步内就从接近 1.0 断崖式下跌到 0.2~0.3，Mask Outlier 的熵则稳定在 0.5 左右；梯度范数走势一致，OPD 持续更高，Clip、Mask Outlier 很快收敛到接近 0。这说明 “裁剪 / 屏蔽能涨分” 的底层机制是减少了破坏性更新，TrOPD 的信任域机制则把这个 “临时补丁” 变成了有理论依据、能自适应的判据。\n续写接着教师语境往下写，后续 token 落入信任域的概率随之提高，不再是被动等离群 token 出现再补救，而是主动引导学生的探索方向。教师前缀长度 l 训练初期设为最大训练长度，之后按余弦调度退火到 0，学生独立生成比例逐步提高，直到完全变成纯粹的在策略生成，这样训练初期就避开了 “学生自由生成、信任域内所剩无几” 的高风险阶段，再逐步放手交给信任域机制自我调节。\n把信任域内的反向 KL、离群区域的前向 KL、离策略引导的前向 KL 合到一起，就是 TrOPD 完整的目标函数：\n实验结果\n在单领域（仅数学）和多领域（数学 + 代码 + 科学）两种场景下，分别用 DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen3-SFT-1.7B 作学生模型做了系统评测。\n表 3：单领域中，TrOPD 相比 OPD 在数学推理上平均提升 +3.06 分，域外任务上提升 +2.63 分；相比同样做了离群点修正的 REOPOLD 仍高出 1.99~1.84 分。多领域下，TrOPD 相比 OPD 提升达 +4.62 分。\n表 4：换成更强的 Qwen3-SFT-1.7B 学生模型和 Qwen3-Nemotron-4B 教师模型，多领域下 TrOPD 相比 OPD 平均提升 +3.44 分，AIME 2024 从 48.02 提升到 52.08，IFBench 从 37.07 提升到 42.18。\n这些数字里，有两个规律值得多说两句。\n第一，TrOPD 的提升不只发生在训练过的领域内。 单领域只用数学题训练，但额外评测了域外（OOD）任务：TrOPD 相比 OPD 在训练过的数学推理上平均提升 +3.06 分，在完全没训练过的代码生成和 STEM 任务上提升幅度反而更大，达到 +2.63 分。模型压根没在这些任务上做过在策略训练，这个提升只能来自更本质的原因：信任域机制让教师监督信号被更可靠地利用，这种优化质量的提升自然会泛化到其他任务。\n第二，教师和学生差得越远的场景，TrOPD 的优势反而越大。 把同一个学生模型放到单领域和多领域（数学 + 代码 + 科学）两种设置下比较：OPD 基线平均分从单领域的 37.11 掉到多领域的 32.99，跌了 4.12 分，任务越杂越难顶住；而 TrOPD 从 40.63 掉到 37.61，只跌了 3.02 分，相对优势反而从 +3.52 分扩大到 +4.62 分。这与信任域机制的设计初衷一致：教师、学生分布差距越大，越需要一套能自适应处理离群点的机制。\n结论与展望\nTrOPD 的意义，在于把在 OPD 的关注点从散度形式的选择，转向监督信号本身的可靠性。信任域以教师与学生的分歧程度为判据，自适应调整学生模型的学习方式，为 OPD 建立了一套有理论依据的稳定机制。教师与学生的能力差距越大，这一机制的收益越为显著，而这正是端侧部署的常态：在受限的参数与算力预算下，仍要求小模型尽可能完整地承接大模型的推理能力。随着端侧智能向更多设备与场景延伸，进一步提升监督信号的可靠性，将持续决定端侧 AI 能力的上限。\n作者信息\n本文第一作者为邢兴润博士，现任三星大模型团队研究员。他博士毕业于中国科学院自动化研究所，曾在北京智源人工智能研究院等机构开展研究工作，长期专注于大模型强化学习、高效推理等方向。\n本文通讯作者为唐业辉博士。公开资料显示，他现任三星大模型团队负责人、高级技术总监。作为全球规模最大的科技企业之一，三星拥有庞大的研发体系，而 “95 后” 的唐业辉已成为其最年轻的部门负责人，主导大模型训练及核心技术研发。他博士毕业于北京大学，曾入选 “天才少年” 计划，其研究成果在 Google Scholar 上累计引用超过 1.4 万次，并长期担任 NeurIPS、ICML、ICLR 等国际顶级 AI 会议领域主席（Area Chair）。","image_url":"//q0.itc.cn/images01/20260918/dc257afb10634a4d881ae592cd7e3bf1.jpeg","lang":"zh","published_at":"2026-09-18T06:18:04+00:00","fetched_at":"2026-09-18T07:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端\n- 标题：Trust Region On-Policy Distillation\n- 文章地址：https://arxiv.org/abs/2606.01249\n- 项目地址：https://github.com/Xingrun-Xing2/TrOPD\nGPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。\n对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。\nOn-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。\n针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。\n核心结论\n当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：\n不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。\n沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。\n图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。\n问题：K1 估计器的两个优化瓶颈\n要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。\n全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。\n为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：\n这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。\n瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励\n这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？\n现状综述：主流方法都在改什么\n面对这两个瓶颈，现有工作大致沿两条思路修补。\n思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。\n这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。\n诊断实验：先把 OPD 问题找出来\n把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：\n表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。\n三个现象，和上一节的理论推演对照着看，很能说明问题：\n1. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。\n3.","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://m.sohu.com/a/1077764200_129720?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5146 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5146,"summary_length":2560,"usable_text_length":5146,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5146,"summary_length":2560}},"news_item":{"id":85047,"canonical_url":"https://m.sohu.com/a/1077764200_129720?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source_url":"https://m.sohu.com/a/1077764200_129720?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","title":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端 - Sohu","source_name":"Sohu","author":null,"published_at":"2026-09-18T06:18:04+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiiAFBVV95cUxOWWlhUk9IVXFMeS1MRmkxUUJyZHpRUEoxOW9IUjhrOUdpMnBKTEVFV0NnWDhwWklqZWkzT0hnS0MtbnZQVmhmb2l1eVUxYk9MUThWQW54TW9FVGpWRTJHWjJVa3prcWdaX0I2MmIzZi10NFNZd1piX3dJeDdiRDBzV2NGUnpmUUlY?oc=5\" target=\"_blank\">大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">Sohu</font>","full_text":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端\n- 标题：Trust Region On-Policy Distillation\n- 文章地址：https://arxiv.org/abs/2606.01249\n- 项目地址：https://github.com/Xingrun-Xing2/TrOPD\nGPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。\n对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。\nOn-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。\n针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。\n核心结论\n当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：\n不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。\n沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。\n图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。\n问题：K1 估计器的两个优化瓶颈\n要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。\n全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。\n为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：\n这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。\n瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励\n这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？\n现状综述：主流方法都在改什么\n面对这两个瓶颈，现有工作大致沿两条思路修补。\n思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。\n这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。\n诊断实验：先把 OPD 问题找出来\n把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：\n表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。\n三个现象，和上一节的理论推演对照着看，很能说明问题：\n1. 单独用 top-k 估计的 FKL，训练几乎直接失败。这印证了 top-k 截断 FKL 从教师的概率角度进行估计，依然存在较大的偏差。\n2. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。\n3. 奖励裁剪确实有效果，但依赖超参数。 Clip Outlier（47.86）和 Mask Outlier（47.72）都比 OPD 基线高出约 1 个点，说明 “抑制离群梯度” 方向是对的。但阈值 τ 需要人工固定设定，没办法随训练进程自适应。\n三条现象放在一起，指向同一个结论：\n换散度公式，或按熵筛选 token，都没有真正触及问题的根子。判断一个 token 的监督信号是否可靠，不能只看散度公式或熵这类和 “教师是否认可” 无关的指标，而应直接衡量教师和学生在这个 token 上的分歧程度本身。裁剪 / 屏蔽已经摸到了正确方向的边（用奖励大小去筛选），值得进一步探索。\n核心方法：基于信任域的 OPD\n问题出在离群 token 的梯度失真，TrOPD 的思路很直接：借鉴强化学习里的信任域策略优化（TRPO），只在教师信得过的区域做常规的在策略学习，离群区域换一套更保守的监督。\n图 2：TrOPD 总览。学生生成的 token 按教师是否 “认可” 分为信任域和离群区域，分别使用不同的散度估计；同时引入离策略引导，让学生从教师给出的前缀续写。\n给定信任域掩码 M（等于 1 表示这个 token 落在信任域内，等于 0 表示离群），单个 token 的训练目标写成：\n也就是信任域内继续用原来的 K1 反向 KL，离群区域换成基于教师 top-k 词表的前向 KL。\n这个设计在训练曲线上的效果非常直观：\n图 3：相比原始 OPD 和 Clip Outlier，屏蔽离群点（Mask Outlier）训练过程中策略熵更高（探索能力保留更好）、梯度范数更低更稳（优化更平稳）。\nOPD 和 Clip Outlier 的策略熵在训练开始后几十步内就从接近 1.0 断崖式下跌到 0.2~0.3，Mask Outlier 的熵则稳定在 0.5 左右；梯度范数走势一致，OPD 持续更高，Clip、Mask Outlier 很快收敛到接近 0。这说明 “裁剪 / 屏蔽能涨分” 的底层机制是减少了破坏性更新，TrOPD 的信任域机制则把这个 “临时补丁” 变成了有理论依据、能自适应的判据。\n续写接着教师语境往下写，后续 token 落入信任域的概率随之提高，不再是被动等离群 token 出现再补救，而是主动引导学生的探索方向。教师前缀长度 l 训练初期设为最大训练长度，之后按余弦调度退火到 0，学生独立生成比例逐步提高，直到完全变成纯粹的在策略生成，这样训练初期就避开了 “学生自由生成、信任域内所剩无几” 的高风险阶段，再逐步放手交给信任域机制自我调节。\n把信任域内的反向 KL、离群区域的前向 KL、离策略引导的前向 KL 合到一起，就是 TrOPD 完整的目标函数：\n实验结果\n在单领域（仅数学）和多领域（数学 + 代码 + 科学）两种场景下，分别用 DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen3-SFT-1.7B 作学生模型做了系统评测。\n表 3：单领域中，TrOPD 相比 OPD 在数学推理上平均提升 +3.06 分，域外任务上提升 +2.63 分；相比同样做了离群点修正的 REOPOLD 仍高出 1.99~1.84 分。多领域下，TrOPD 相比 OPD 提升达 +4.62 分。\n表 4：换成更强的 Qwen3-SFT-1.7B 学生模型和 Qwen3-Nemotron-4B 教师模型，多领域下 TrOPD 相比 OPD 平均提升 +3.44 分，AIME 2024 从 48.02 提升到 52.08，IFBench 从 37.07 提升到 42.18。\n这些数字里，有两个规律值得多说两句。\n第一，TrOPD 的提升不只发生在训练过的领域内。 单领域只用数学题训练，但额外评测了域外（OOD）任务：TrOPD 相比 OPD 在训练过的数学推理上平均提升 +3.06 分，在完全没训练过的代码生成和 STEM 任务上提升幅度反而更大，达到 +2.63 分。模型压根没在这些任务上做过在策略训练，这个提升只能来自更本质的原因：信任域机制让教师监督信号被更可靠地利用，这种优化质量的提升自然会泛化到其他任务。\n第二，教师和学生差得越远的场景，TrOPD 的优势反而越大。 把同一个学生模型放到单领域和多领域（数学 + 代码 + 科学）两种设置下比较：OPD 基线平均分从单领域的 37.11 掉到多领域的 32.99，跌了 4.12 分，任务越杂越难顶住；而 TrOPD 从 40.63 掉到 37.61，只跌了 3.02 分，相对优势反而从 +3.52 分扩大到 +4.62 分。这与信任域机制的设计初衷一致：教师、学生分布差距越大，越需要一套能自适应处理离群点的机制。\n结论与展望\nTrOPD 的意义，在于把在 OPD 的关注点从散度形式的选择，转向监督信号本身的可靠性。信任域以教师与学生的分歧程度为判据，自适应调整学生模型的学习方式，为 OPD 建立了一套有理论依据的稳定机制。教师与学生的能力差距越大，这一机制的收益越为显著，而这正是端侧部署的常态：在受限的参数与算力预算下，仍要求小模型尽可能完整地承接大模型的推理能力。随着端侧智能向更多设备与场景延伸，进一步提升监督信号的可靠性，将持续决定端侧 AI 能力的上限。\n作者信息\n本文第一作者为邢兴润博士，现任三星大模型团队研究员。他博士毕业于中国科学院自动化研究所，曾在北京智源人工智能研究院等机构开展研究工作，长期专注于大模型强化学习、高效推理等方向。\n本文通讯作者为唐业辉博士。公开资料显示，他现任三星大模型团队负责人、高级技术总监。作为全球规模最大的科技企业之一，三星拥有庞大的研发体系，而 “95 后” 的唐业辉已成为其最年轻的部门负责人，主导大模型训练及核心技术研发。他博士毕业于北京大学，曾入选 “天才少年” 计划，其研究成果在 Google Scholar 上累计引用超过 1.4 万次，并长期担任 NeurIPS、ICML、ICLR 等国际顶级 AI 会议领域主席（Area Chair）。","excerpt":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端\n- 标题：Trust Region On-Policy Distillation\n- 文章地址：https://arxiv.org/abs/2606.01249\n- 项目地址：https://github.com/Xingrun-Xing2/TrOPD\nGPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。\n对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。\nOn-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。\n针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。\n核心结论\n当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：\n不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。\n沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。\n图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。\n问题：K1 估计器的两个优化瓶颈\n要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。\n全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。\n为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：\n这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。\n瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励\n这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？\n现状综述：主流方法都在改什么\n面对这两个瓶颈，现有工作大致沿两条思路修补。\n思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。\n这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。\n诊断实验：先把 OPD 问题找出来\n把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：\n表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。\n三个现象，和上一节的理论推演对照着看，很能说明问题：\n1. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。\n3.","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 5146 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1077764200_129720%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5146 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5146,"summary_length":2560,"usable_text_length":5146,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5146,"summary_length":2560}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端 - Sohu","url":"https://m.sohu.com/a/1077764200_129720?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端\n- 标题：Trust Region On-Policy Distillation\n- 文章地址：https://arxiv.org/abs/2606.01249\n- 项目地址：https://github.com/Xingrun-Xing2/TrOPD\nGPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。\n对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。\nOn-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。\n针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。\n核心结论\n当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：\n不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。\n沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。\n图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。\n问题：K1 估计器的两个优化瓶颈\n要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。\n全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。\n为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：\n这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。\n瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励\n这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？\n现状综述：主流方法都在改什么\n面对这两个瓶颈，现有工作大致沿两条思路修补。\n思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。\n这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。\n诊断实验：先把 OPD 问题找出来\n把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：\n表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。\n三个现象，和上一节的理论推演对照着看，很能说明问题：\n1. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。\n3.","source":"Sohu","date":"2026-09-18T06:18:04+00:00","content":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端\n- 标题：Trust Region On-Policy Distillation\n- 文章地址：https://arxiv.org/abs/2606.01249\n- 项目地址：https://github.com/Xingrun-Xing2/TrOPD\nGPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。\n对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。\nOn-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。\n针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。\n核心结论\n当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：\n不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。\n沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。\n图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。\n问题：K1 估计器的两个优化瓶颈\n要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。\n全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。\n为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：\n这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。\n瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励\n这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？\n现状综述：主流方法都在改什么\n面对这两个瓶颈，现有工作大致沿两条思路修补。\n思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。\n这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。\n诊断实验：先把 OPD 问题找出来\n把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：\n表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。\n三个现象，和上一节的理论推演对照着看，很能说明问题：\n1. 单独用 top-k 估计的 FKL，训练几乎直接失败。这印证了 top-k 截断 FKL 从教师的概率角度进行估计，依然存在较大的偏差。\n2. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。\n3. 奖励裁剪确实有效果，但依赖超参数。 Clip Outlier（47.86）和 Mask Outlier（47.72）都比 OPD 基线高出约 1 个点，说明 “抑制离群梯度” 方向是对的。但阈值 τ 需要人工固定设定，没办法随训练进程自适应。\n三条现象放在一起，指向同一个结论：\n换散度公式，或按熵筛选 token，都没有真正触及问题的根子。判断一个 token 的监督信号是否可靠，不能只看散度公式或熵这类和 “教师是否认可” 无关的指标，而应直接衡量教师和学生在这个 token 上的分歧程度本身。裁剪 / 屏蔽已经摸到了正确方向的边（用奖励大小去筛选），值得进一步探索。\n核心方法：基于信任域的 OPD\n问题出在离群 token 的梯度失真，TrOPD 的思路很直接：借鉴强化学习里的信任域策略优化（TRPO），只在教师信得过的区域做常规的在策略学习，离群区域换一套更保守的监督。\n图 2：TrOPD 总览。学生生成的 token 按教师是否 “认可” 分为信任域和离群区域，分别使用不同的散度估计；同时引入离策略引导，让学生从教师给出的前缀续写。\n给定信任域掩码 M（等于 1 表示这个 token 落在信任域内，等于 0 表示离群），单个 token 的训练目标写成：\n也就是信任域内继续用原来的 K1 反向 KL，离群区域换成基于教师 top-k 词表的前向 KL。\n这个设计在训练曲线上的效果非常直观：\n图 3：相比原始 OPD 和 Clip Outlier，屏蔽离群点（Mask Outlier）训练过程中策略熵更高（探索能力保留更好）、梯度范数更低更稳（优化更平稳）。\nOPD 和 Clip Outlier 的策略熵在训练开始后几十步内就从接近 1.0 断崖式下跌到 0.2~0.3，Mask Outlier 的熵则稳定在 0.5 左右；梯度范数走势一致，OPD 持续更高，Clip、Mask Outlier 很快收敛到接近 0。这说明 “裁剪 / 屏蔽能涨分” 的底层机制是减少了破坏性更新，TrOPD 的信任域机制则把这个 “临时补丁” 变成了有理论依据、能自适应的判据。\n续写接着教师语境往下写，后续 token 落入信任域的概率随之提高，不再是被动等离群 token 出现再补救，而是主动引导学生的探索方向。教师前缀长度 l 训练初期设为最大训练长度，之后按余弦调度退火到 0，学生独立生成比例逐步提高，直到完全变成纯粹的在策略生成，这样训练初期就避开了 “学生自由生成、信任域内所剩无几” 的高风险阶段，再逐步放手交给信任域机制自我调节。\n把信任域内的反向 KL、离群区域的前向 KL、离策略引导的前向 KL 合到一起，就是 TrOPD 完整的目标函数：\n实验结果\n在单领域（仅数学）和多领域（数学 + 代码 + 科学）两种场景下，分别用 DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen3-SFT-1.7B 作学生模型做了系统评测。\n表 3：单领域中，TrOPD 相比 OPD 在数学推理上平均提升 +3.06 分，域外任务上提升 +2.63 分；相比同样做了离群点修正的 REOPOLD 仍高出 1.99~1.84 分。多领域下，TrOPD 相比 OPD 提升达 +4.62 分。\n表 4：换成更强的 Qwen3-SFT-1.7B 学生模型和 Qwen3-Nemotron-4B 教师模型，多领域下 TrOPD 相比 OPD 平均提升 +3.44 分，AIME 2024 从 48.02 提升到 52.08，IFBench 从 37.07 提升到 42.18。\n这些数字里，有两个规律值得多说两句。\n第一，TrOPD 的提升不只发生在训练过的领域内。 单领域只用数学题训练，但额外评测了域外（OOD）任务：TrOPD 相比 OPD 在训练过的数学推理上平均提升 +3.06 分，在完全没训练过的代码生成和 STEM 任务上提升幅度反而更大，达到 +2.63 分。模型压根没在这些任务上做过在策略训练，这个提升只能来自更本质的原因：信任域机制让教师监督信号被更可靠地利用，这种优化质量的提升自然会泛化到其他任务。\n第二，教师和学生差得越远的场景，TrOPD 的优势反而越大。 把同一个学生模型放到单领域和多领域（数学 + 代码 + 科学）两种设置下比较：OPD 基线平均分从单领域的 37.11 掉到多领域的 32.99，跌了 4.12 分，任务越杂越难顶住；而 TrOPD 从 40.63 掉到 37.61，只跌了 3.02 分，相对优势反而从 +3.52 分扩大到 +4.62 分。这与信任域机制的设计初衷一致：教师、学生分布差距越大，越需要一套能自适应处理离群点的机制。\n结论与展望\nTrOPD 的意义，在于把在 OPD 的关注点从散度形式的选择，转向监督信号本身的可靠性。信任域以教师与学生的分歧程度为判据，自适应调整学生模型的学习方式，为 OPD 建立了一套有理论依据的稳定机制。教师与学生的能力差距越大，这一机制的收益越为显著，而这正是端侧部署的常态：在受限的参数与算力预算下，仍要求小模型尽可能完整地承接大模型的推理能力。随着端侧智能向更多设备与场景延伸，进一步提升监督信号的可靠性，将持续决定端侧 AI 能力的上限。\n作者信息\n本文第一作者为邢兴润博士，现任三星大模型团队研究员。他博士毕业于中国科学院自动化研究所，曾在北京智源人工智能研究院等机构开展研究工作，长期专注于大模型强化学习、高效推理等方向。\n本文通讯作者为唐业辉博士。公开资料显示，他现任三星大模型团队负责人、高级技术总监。作为全球规模最大的科技企业之一，三星拥有庞大的研发体系，而 “95 后” 的唐业辉已成为其最年轻的部门负责人，主导大模型训练及核心技术研发。他博士毕业于北京大学，曾入选 “天才少年” 计划，其研究成果在 Google Scholar 上累计引用超过 1.4 万次，并长期担任 NeurIPS、ICML、ICLR 等国际顶级 AI 会议领域主席（Area Chair）。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1077764200_129720%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 5146 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5146 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5146,"summary_length":2560,"usable_text_length":5146,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5146,"summary_length":2560}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/85047","export_markdown":"/api/items/85047/export?format=markdown","export_json":"/api/items/85047/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1077764200_129720%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"formats":{"full":{"id":85047,"title":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端 - Sohu","url":"https://m.sohu.com/a/1077764200_129720?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"Sohu","author":null,"published_at":"2026-09-18T06:18:04+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端\n- 标题：Trust Region On-Policy Distillation\n- 文章地址：https://arxiv.org/abs/2606.01249\n- 项目地址：https://github.com/Xingrun-Xing2/TrOPD\nGPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。\n对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。\nOn-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。\n针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。\n核心结论\n当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：\n不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。\n沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。\n图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。\n问题：K1 估计器的两个优化瓶颈\n要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。\n全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。\n为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：\n这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。\n瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励\n这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？\n现状综述：主流方法都在改什么\n面对这两个瓶颈，现有工作大致沿两条思路修补。\n思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。\n这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。\n诊断实验：先把 OPD 问题找出来\n把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：\n表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。\n三个现象，和上一节的理论推演对照着看，很能说明问题：\n1. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。\n3.","full_text":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端\n- 标题：Trust Region On-Policy Distillation\n- 文章地址：https://arxiv.org/abs/2606.01249\n- 项目地址：https://github.com/Xingrun-Xing2/TrOPD\nGPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。\n对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。\nOn-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。\n针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。\n核心结论\n当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：\n不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。\n沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。\n图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。\n问题：K1 估计器的两个优化瓶颈\n要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。\n全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。\n为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：\n这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。\n瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励\n这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？\n现状综述：主流方法都在改什么\n面对这两个瓶颈，现有工作大致沿两条思路修补。\n思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。\n这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。\n诊断实验：先把 OPD 问题找出来\n把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：\n表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。\n三个现象，和上一节的理论推演对照着看，很能说明问题：\n1. 单独用 top-k 估计的 FKL，训练几乎直接失败。这印证了 top-k 截断 FKL 从教师的概率角度进行估计，依然存在较大的偏差。\n2. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。\n3. 奖励裁剪确实有效果，但依赖超参数。 Clip Outlier（47.86）和 Mask Outlier（47.72）都比 OPD 基线高出约 1 个点，说明 “抑制离群梯度” 方向是对的。但阈值 τ 需要人工固定设定，没办法随训练进程自适应。\n三条现象放在一起，指向同一个结论：\n换散度公式，或按熵筛选 token，都没有真正触及问题的根子。判断一个 token 的监督信号是否可靠，不能只看散度公式或熵这类和 “教师是否认可” 无关的指标，而应直接衡量教师和学生在这个 token 上的分歧程度本身。裁剪 / 屏蔽已经摸到了正确方向的边（用奖励大小去筛选），值得进一步探索。\n核心方法：基于信任域的 OPD\n问题出在离群 token 的梯度失真，TrOPD 的思路很直接：借鉴强化学习里的信任域策略优化（TRPO），只在教师信得过的区域做常规的在策略学习，离群区域换一套更保守的监督。\n图 2：TrOPD 总览。学生生成的 token 按教师是否 “认可” 分为信任域和离群区域，分别使用不同的散度估计；同时引入离策略引导，让学生从教师给出的前缀续写。\n给定信任域掩码 M（等于 1 表示这个 token 落在信任域内，等于 0 表示离群），单个 token 的训练目标写成：\n也就是信任域内继续用原来的 K1 反向 KL，离群区域换成基于教师 top-k 词表的前向 KL。\n这个设计在训练曲线上的效果非常直观：\n图 3：相比原始 OPD 和 Clip Outlier，屏蔽离群点（Mask Outlier）训练过程中策略熵更高（探索能力保留更好）、梯度范数更低更稳（优化更平稳）。\nOPD 和 Clip Outlier 的策略熵在训练开始后几十步内就从接近 1.0 断崖式下跌到 0.2~0.3，Mask Outlier 的熵则稳定在 0.5 左右；梯度范数走势一致，OPD 持续更高，Clip、Mask Outlier 很快收敛到接近 0。这说明 “裁剪 / 屏蔽能涨分” 的底层机制是减少了破坏性更新，TrOPD 的信任域机制则把这个 “临时补丁” 变成了有理论依据、能自适应的判据。\n续写接着教师语境往下写，后续 token 落入信任域的概率随之提高，不再是被动等离群 token 出现再补救，而是主动引导学生的探索方向。教师前缀长度 l 训练初期设为最大训练长度，之后按余弦调度退火到 0，学生独立生成比例逐步提高，直到完全变成纯粹的在策略生成，这样训练初期就避开了 “学生自由生成、信任域内所剩无几” 的高风险阶段，再逐步放手交给信任域机制自我调节。\n把信任域内的反向 KL、离群区域的前向 KL、离策略引导的前向 KL 合到一起，就是 TrOPD 完整的目标函数：\n实验结果\n在单领域（仅数学）和多领域（数学 + 代码 + 科学）两种场景下，分别用 DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen3-SFT-1.7B 作学生模型做了系统评测。\n表 3：单领域中，TrOPD 相比 OPD 在数学推理上平均提升 +3.06 分，域外任务上提升 +2.63 分；相比同样做了离群点修正的 REOPOLD 仍高出 1.99~1.84 分。多领域下，TrOPD 相比 OPD 提升达 +4.62 分。\n表 4：换成更强的 Qwen3-SFT-1.7B 学生模型和 Qwen3-Nemotron-4B 教师模型，多领域下 TrOPD 相比 OPD 平均提升 +3.44 分，AIME 2024 从 48.02 提升到 52.08，IFBench 从 37.07 提升到 42.18。\n这些数字里，有两个规律值得多说两句。\n第一，TrOPD 的提升不只发生在训练过的领域内。 单领域只用数学题训练，但额外评测了域外（OOD）任务：TrOPD 相比 OPD 在训练过的数学推理上平均提升 +3.06 分，在完全没训练过的代码生成和 STEM 任务上提升幅度反而更大，达到 +2.63 分。模型压根没在这些任务上做过在策略训练，这个提升只能来自更本质的原因：信任域机制让教师监督信号被更可靠地利用，这种优化质量的提升自然会泛化到其他任务。\n第二，教师和学生差得越远的场景，TrOPD 的优势反而越大。 把同一个学生模型放到单领域和多领域（数学 + 代码 + 科学）两种设置下比较：OPD 基线平均分从单领域的 37.11 掉到多领域的 32.99，跌了 4.12 分，任务越杂越难顶住；而 TrOPD 从 40.63 掉到 37.61，只跌了 3.02 分，相对优势反而从 +3.52 分扩大到 +4.62 分。这与信任域机制的设计初衷一致：教师、学生分布差距越大，越需要一套能自适应处理离群点的机制。\n结论与展望\nTrOPD 的意义，在于把在 OPD 的关注点从散度形式的选择，转向监督信号本身的可靠性。信任域以教师与学生的分歧程度为判据，自适应调整学生模型的学习方式，为 OPD 建立了一套有理论依据的稳定机制。教师与学生的能力差距越大，这一机制的收益越为显著，而这正是端侧部署的常态：在受限的参数与算力预算下，仍要求小模型尽可能完整地承接大模型的推理能力。随着端侧智能向更多设备与场景延伸，进一步提升监督信号的可靠性，将持续决定端侧 AI 能力的上限。\n作者信息\n本文第一作者为邢兴润博士，现任三星大模型团队研究员。他博士毕业于中国科学院自动化研究所，曾在北京智源人工智能研究院等机构开展研究工作，长期专注于大模型强化学习、高效推理等方向。\n本文通讯作者为唐业辉博士。公开资料显示，他现任三星大模型团队负责人、高级技术总监。作为全球规模最大的科技企业之一，三星拥有庞大的研发体系，而 “95 后” 的唐业辉已成为其最年轻的部门负责人，主导大模型训练及核心技术研发。他博士毕业于北京大学，曾入选 “天才少年” 计划，其研究成果在 Google Scholar 上累计引用超过 1.4 万次，并长期担任 NeurIPS、ICML、ICLR 等国际顶级 AI 会议领域主席（Area Chair）。","reading_time_min":2,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 5146 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1077764200_129720%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5146 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5146,"summary_length":2560,"usable_text_length":5146,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5146,"summary_length":2560}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5146 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5146,"summary_length":2560,"usable_text_length":5146,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5146,"summary_length":2560}},"actions":{"read":"/item/85047","export_markdown":"/api/items/85047/export?format=markdown","export_json":"/api/items/85047/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1077764200_129720%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"}},"digest":{"id":85047,"title":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端 - Sohu","url":"https://m.sohu.com/a/1077764200_129720?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"Sohu","topic":"ai","published_at":"2026-09-18T06:18:04+00:00","excerpt":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端 - 标题：Trust Region On-Policy Distillation - 文章地址：https://arxiv.org/abs/2606.01249 - 项目地址：https://github.com/Xingrun-Xing2/TrOPD GPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 5146 characters.","reading_time_min":2,"cluster_id":null},"card":{"display_title":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端 - Sohu","subtitle":"Sohu · 2026-09-18","summary":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端 - 标题：Trust Region On-Policy Distillation - 文章地址：https://arxiv.org/abs/2606.01249 - 项目地址：https://github.com/Xingrun-Xing2/TrOPD GPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI…","badges":["quality:high"],"links":{"read":"/item/85047","original":"https://m.sohu.com/a/1077764200_129720?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1077764200_129720%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"quality_warning":null},"export":{"title":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端 - Sohu","url":"https://m.sohu.com/a/1077764200_129720?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端\n- 标题：Trust Region On-Policy Distillation\n- 文章地址：https://arxiv.org/abs/2606.01249\n- 项目地址：https://github.com/Xingrun-Xing2/TrOPD\nGPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。\n对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。\nOn-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。\n针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。\n核心结论\n当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：\n不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。\n沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。\n图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。\n问题：K1 估计器的两个优化瓶颈\n要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。\n全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。\n为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：\n这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。\n瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励\n这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？\n现状综述：主流方法都在改什么\n面对这两个瓶颈，现有工作大致沿两条思路修补。\n思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。\n这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。\n诊断实验：先把 OPD 问题找出来\n把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：\n表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。\n三个现象，和上一节的理论推演对照着看，很能说明问题：\n1. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。\n3.","source":"Sohu","date":"2026-09-18T06:18:04+00:00","content":"大模型Scaling撞上成本墙：三星提出TrOPD新方法，把前沿智能塞进数亿终端\n- 标题：Trust Region On-Policy Distillation\n- 文章地址：https://arxiv.org/abs/2606.01249\n- 项目地址：https://github.com/Xingrun-Xing2/TrOPD\nGPT-6 等前沿大模型的能力仍在快速 Scaling，但随之攀升的推理成本，正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端，模型不仅要 “足够聪明”，还必须塞进有限的内存和算力预算，并满足功耗、时延等严苛约束。\n对于拥有数亿级终端设备的三星而言，这一矛盾更加直接：如何用更小的模型、更低的推理成本承载更多智能，让前沿 AI 能力进入更多终端，已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力，不仅决定 AI 能覆盖多少设备和应用场景，也直接影响智能服务的成本与用户体验。\nOn-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO，OPD 利用教师大模型提供细粒度监督，让端侧模型直接学习更强模型的推理能力。然而，现有 OPD 面临一个关键瓶颈：当教师与学生模型能力差距较大时，监督信号可能失真，甚至导致训练不稳定。\n针对这一问题，三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法（Trust Region On-Policy Distillation），通过识别教师 “可信” 的监督区域，让端侧模型更稳定、更有效地继承大模型能力，为前沿智能以更低成本走向数亿终端提供了一条新路径。\n核心结论\n当前关于 On-Policy Distillation（OPD）的研究，大多缺少统一 benchmark 下的公平对比：不同工作的训练步数、KL 散度估计方式各不相同，很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍，由此发现了真正决定 OPD 训练成败的关键：\n不是该用哪种散度公式（FKL、RKL 还是 JSD），而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远，监督信号本身就会失真，再精巧的散度公式也救不回来。\n沿着这个发现，提出 TrOPD （Trust Region On-Policy Distillation）：只在教师 “信得过” 的区域做常规的在策略学习，对教师 “看不懂” 的离群区域换一种更温和的监督，再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上，TrOPD 在数学（AIME 25）、代码（LiveCodeBench）、指令遵循（IFBench）、STEM（GPQA）四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分，全面超过 EOPD、REOPOLD 等现有方法。\n图 1：在 Qwen3-SFT-1.7B 学生模型上，TrOPD（紫色）相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本，仅作为参考。\n问题：K1 估计器的两个优化瓶颈\n要理解 OPD 为什么会训崩，得先看懂它现在是怎么给 “教师的分数” 打分的。\n全词表 OPD 方法（如 GKD、speculative KD）在整个词表上计算 KL 散度，信号最完整，但显存开销是 On⋅k（n 为序列长度，k 为词表大小，常见 LLM 词表动辄十万级），推理模型动辄生成几千上万 token 的思维链，这个开销很快变得不可承受。\n为了绕开这个瓶颈，Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计，不再对整个词表求和，只在学生实际采样到的那一个 token 上算一次：\n这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On，代价是优化过程的稳定性，集中体现为两个具体的瓶颈。\n瓶颈一：策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”：奖励\n这两个瓶颈说明：光是把 “全词表 KL” 换成省显存的 K1 估计器还不够，它解决了显存问题，却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么，现有的改进思路解决了这个问题吗？\n现状综述：主流方法都在改什么\n面对这两个瓶颈，现有工作大致沿两条思路修补。\n思路二：筛 token，不改公式。 与其修改散度估计，不如直接把 “不靠谱” 的 token 排除在训练之外，常见三种设定：受高熵 GRPO 方法的启发，只保留熵最高的前 20% token、其余置零；REOPOLD 保留全部 token 但给奖励设下限，把低于阈值 τ 的奖励抬到 τ，属于 “温和纠偏”；Token 掩码（Mask）更彻底，直接把超出阈值的奖励梯度清零，即 “完全无视”。\n这些改法各自都讲得通，却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用，只能靠实验说话。\n诊断实验：先把 OPD 问题找出来\n把上述方案统一放到相同的教师模型（Skywork-OR1-Math-7B）、学生模型（DeepSeek-Qwen2.5-1.5B）、训练配置下训了一遍，数学推理基准结果如下：\n表 1：以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动；裁剪或屏蔽离群奖励有明显提升；离群区域改用前向 KL 效果更好；TrOPD 综合最优。\n三个现象，和上一节的理论推演对照着看，很能说明问题：\n1. 单独用 top-k 估计的 FKL，训练几乎直接失败。这印证了 top-k 截断 FKL 从教师的概率角度进行估计，依然存在较大的偏差。\n2. 按熵筛选 token，反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13，比什么都不做的 OPD（RKL）基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督，只学高熵 token 反而丢掉了更多有效信号。\n3. 奖励裁剪确实有效果，但依赖超参数。 Clip Outlier（47.86）和 Mask Outlier（47.72）都比 OPD 基线高出约 1 个点，说明 “抑制离群梯度” 方向是对的。但阈值 τ 需要人工固定设定，没办法随训练进程自适应。\n三条现象放在一起，指向同一个结论：\n换散度公式，或按熵筛选 token，都没有真正触及问题的根子。判断一个 token 的监督信号是否可靠，不能只看散度公式或熵这类和 “教师是否认可” 无关的指标，而应直接衡量教师和学生在这个 token 上的分歧程度本身。裁剪 / 屏蔽已经摸到了正确方向的边（用奖励大小去筛选），值得进一步探索。\n核心方法：基于信任域的 OPD\n问题出在离群 token 的梯度失真，TrOPD 的思路很直接：借鉴强化学习里的信任域策略优化（TRPO），只在教师信得过的区域做常规的在策略学习，离群区域换一套更保守的监督。\n图 2：TrOPD 总览。学生生成的 token 按教师是否 “认可” 分为信任域和离群区域，分别使用不同的散度估计；同时引入离策略引导，让学生从教师给出的前缀续写。\n给定信任域掩码 M（等于 1 表示这个 token 落在信任域内，等于 0 表示离群），单个 token 的训练目标写成：\n也就是信任域内继续用原来的 K1 反向 KL，离群区域换成基于教师 top-k 词表的前向 KL。\n这个设计在训练曲线上的效果非常直观：\n图 3：相比原始 OPD 和 Clip Outlier，屏蔽离群点（Mask Outlier）训练过程中策略熵更高（探索能力保留更好）、梯度范数更低更稳（优化更平稳）。\nOPD 和 Clip Outlier 的策略熵在训练开始后几十步内就从接近 1.0 断崖式下跌到 0.2~0.3，Mask Outlier 的熵则稳定在 0.5 左右；梯度范数走势一致，OPD 持续更高，Clip、Mask Outlier 很快收敛到接近 0。这说明 “裁剪 / 屏蔽能涨分” 的底层机制是减少了破坏性更新，TrOPD 的信任域机制则把这个 “临时补丁” 变成了有理论依据、能自适应的判据。\n续写接着教师语境往下写，后续 token 落入信任域的概率随之提高，不再是被动等离群 token 出现再补救，而是主动引导学生的探索方向。教师前缀长度 l 训练初期设为最大训练长度，之后按余弦调度退火到 0，学生独立生成比例逐步提高，直到完全变成纯粹的在策略生成，这样训练初期就避开了 “学生自由生成、信任域内所剩无几” 的高风险阶段，再逐步放手交给信任域机制自我调节。\n把信任域内的反向 KL、离群区域的前向 KL、离策略引导的前向 KL 合到一起，就是 TrOPD 完整的目标函数：\n实验结果\n在单领域（仅数学）和多领域（数学 + 代码 + 科学）两种场景下，分别用 DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen3-SFT-1.7B 作学生模型做了系统评测。\n表 3：单领域中，TrOPD 相比 OPD 在数学推理上平均提升 +3.06 分，域外任务上提升 +2.63 分；相比同样做了离群点修正的 REOPOLD 仍高出 1.99~1.84 分。多领域下，TrOPD 相比 OPD 提升达 +4.62 分。\n表 4：换成更强的 Qwen3-SFT-1.7B 学生模型和 Qwen3-Nemotron-4B 教师模型，多领域下 TrOPD 相比 OPD 平均提升 +3.44 分，AIME 2024 从 48.02 提升到 52.08，IFBench 从 37.07 提升到 42.18。\n这些数字里，有两个规律值得多说两句。\n第一，TrOPD 的提升不只发生在训练过的领域内。 单领域只用数学题训练，但额外评测了域外（OOD）任务：TrOPD 相比 OPD 在训练过的数学推理上平均提升 +3.06 分，在完全没训练过的代码生成和 STEM 任务上提升幅度反而更大，达到 +2.63 分。模型压根没在这些任务上做过在策略训练，这个提升只能来自更本质的原因：信任域机制让教师监督信号被更可靠地利用，这种优化质量的提升自然会泛化到其他任务。\n第二，教师和学生差得越远的场景，TrOPD 的优势反而越大。 把同一个学生模型放到单领域和多领域（数学 + 代码 + 科学）两种设置下比较：OPD 基线平均分从单领域的 37.11 掉到多领域的 32.99，跌了 4.12 分，任务越杂越难顶住；而 TrOPD 从 40.63 掉到 37.61，只跌了 3.02 分，相对优势反而从 +3.52 分扩大到 +4.62 分。这与信任域机制的设计初衷一致：教师、学生分布差距越大，越需要一套能自适应处理离群点的机制。\n结论与展望\nTrOPD 的意义，在于把在 OPD 的关注点从散度形式的选择，转向监督信号本身的可靠性。信任域以教师与学生的分歧程度为判据，自适应调整学生模型的学习方式，为 OPD 建立了一套有理论依据的稳定机制。教师与学生的能力差距越大，这一机制的收益越为显著，而这正是端侧部署的常态：在受限的参数与算力预算下，仍要求小模型尽可能完整地承接大模型的推理能力。随着端侧智能向更多设备与场景延伸，进一步提升监督信号的可靠性，将持续决定端侧 AI 能力的上限。\n作者信息\n本文第一作者为邢兴润博士，现任三星大模型团队研究员。他博士毕业于中国科学院自动化研究所，曾在北京智源人工智能研究院等机构开展研究工作，长期专注于大模型强化学习、高效推理等方向。\n本文通讯作者为唐业辉博士。公开资料显示，他现任三星大模型团队负责人、高级技术总监。作为全球规模最大的科技企业之一，三星拥有庞大的研发体系，而 “95 后” 的唐业辉已成为其最年轻的部门负责人，主导大模型训练及核心技术研发。他博士毕业于北京大学，曾入选 “天才少年” 计划，其研究成果在 Google Scholar 上累计引用超过 1.4 万次，并长期担任 NeurIPS、ICML、ICLR 等国际顶级 AI 会议领域主席（Area Chair）。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1077764200_129720%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 5146 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5146 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5146,"summary_length":2560,"usable_text_length":5146,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5146,"summary_length":2560}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}