# 小米大模型6天“烧掉”347万美元 - t.cj.sina.cn

*Источник: t.cj.sina.cn*
*Дата: 2026-09-23*
*Язык: zh*

**Кратко:** 21世纪经济报道记者雷晨
9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。
小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。
据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。
烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。
技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。
能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。
开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。
客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。

21世纪经济报道记者雷晨
9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。
小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。
据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。
烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。
技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。
能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。
开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。
客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。

[Оригинал](https://t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k)