# 小米大模型6天训练烧掉347万美元，罗福莉发声 - 新浪财经_金融信息服务商

*Источник: 新浪财经_金融信息服务商*
*Дата: 2026-09-22*
*Язык: zh*

**Кратко:** 记者丨雷晨
编辑丨陶力 骆一帆
9月22日，小米发布并开源新一代MiMo大模型，包括全模态旗舰模型MiMo-V2.6-Pro和高效推理模型MiMo-V2.6-Flash，同时上线Pro版本的超高速模式V2.6-Pro-UltraSpeed和MiMo Desktop桌面客户端正式版，后者同步推出会员订阅方案。
第三方测评平台Artificial Analysis综合智能指数显示，MiMo-V2.6-Pro得分为46分，在当前开源权重模型中排名第一，超过了Kimi K3的44分和GLM-5.3的45分，也高于上一代MiMo-V2.5-Pro的26分。该榜单上，GPT-6 Astra和Claude Fable 5.1均为53分。
同一平台的智能指数单任务成本榜单显示，MiMo-V2.6-Pro单任务成本为0.13美元。小米方面称，同等智能水平下，该模型价格仅为海外模型的二十分之一至六十分之一，API定价沿用V2.5系列。
这次发布五日前，训练过程已经提前公开。9月17日凌晨，小米MiMo大模型团队负责人罗福莉在X平台发文，披露MiMo-V2.6正处于强化学习中间阶段，并上线实时训练页面，公开进度、Token消耗与成本数据。在国内大模型厂商中，将后训练环节以实时页面公开，此前尚无先例。
强化学习训练首度直播，小米六天花了347万美元
据小米方面披露，本轮强化学习的后训练耗时不到六天，Pro版本训练成本约262万美元，Flash版本约85万美元，各完成30步，累计约75万条轨迹。罗福莉在发文中称，这六天背后，是长达半年的基础研究积累和工程试错。训练中途，公开页面显示的数据是另一个量级。9月17日下午，两个版本累计成本已超过135万美元，每小时成本约3.1万美元。
成本曲线之外，页面同时披露了训练配置。罗福莉介绍，本次训练从三个方面扩展规模：算力上，采用大Batch与全异步架构，单次更新使用1568个样本，支持百万级上下文长度训练，单步训练Token达2.7B至3.7B；环境与工具上，构建覆盖代码、通用、视觉、安全等方向的多任务训练体系，并混合多个Harness框架运行；评估计算上，通过组内相对比较，为长程任务提供更精准、多样的奖励信号。
结果显示，训练任务平均通过率分别相对提升25%和12%。在样本外的长程软件工程评测基准DeepSWE v1.1中，Flash版本得分由48.8升至65.68，Pro版本由58.4升至72.57。罗福莉称，MiMo-V2.6可能是目前国产开源模型中投入算力最多的模型之一。
投行测算提供了另一个观察角度。高盛研报称，按avg@3口径，两个版本在DeepSWE基准最高取得67.86分和72.57分，Flash版本提升超过19分，Pro版本提升超过14分。成本折算上，Flash每百万Token约10美元，Pro约35美元，同等支出下Flash的分数增幅更高。该行估计，两个版本的训练分别基于约4000个和8000个H200等效GPU集群。直播过程中出现的中途干预包括基建错误重跑、不良模式数据集、零梯度任务与GPU显存不足。高盛认为，这意味着强化学习的瓶颈已经转向工程优化。
罗福莉在发文中将问题归结为“强化学习究竟能扩展到多远”。她表示，强化学习是模型自我提升路径中可扩展性较强的方向之一。小米将本次发布定义为探索RSI（递归自我改进）路径的关键一步。
开源是本次动作的另一面。除Pro与Flash模型权重及技术报告外，小米同步开放了蒸馏版本MiMo-V2.6-Distill-Qwen-9B及配套强化学习代码，包括7000余个高质量任务环境、端到端训练框架与轻量化Harness。小米方面表示，开放这些资源意在帮助研究者复现和验证相关结果。以该蒸馏模型为起点开展训练，SWE-bench Verified得分由61.1升至66.2，Terminal Bench 2.1得分由37.1升至52.8。
46分登顶开源榜，距全球最强模型仍有差距
46分之外，榜单给出了更完整的坐标。综合智能指数总榜上，排在MiMo-V2.6-Pro之前的是GPT-6 Astra、Claude Opus 5、Fable 5.1和Muse Spark 1.3四款闭源模型，小米是前五名中唯一的开源权重模型。
按小米方面的说法，在多数智能体评测中V2.6-Pro已比肩Claude Opus 5和GPT-5.6 Sol，在综合智能指数上与榜首仍有7分差距。
价格方面，单任务成本指标与榜单捆绑出现，指向的是大模型竞争的旧命题：同等智能水平下的成本下探。本次发布口径聚焦“价格不变、能力跃升”。上一代V2.5系列于今年4月以MIT协议开源，更早的V2系列随后于6月30日全面下线，开发者已完成迁移。不到半年再发新一代，小米模型迭代节奏仍在加快。
参数规模并非本次发布与前代的显著差异。小米方面称，MiMo-V2.6的预训练架构和参数规模与上一代保持一致，能力提升主要来自后训练环节。这一表述与五天前的直播相互印证：研发重心压在强化学习扩展上，而非继续堆叠参数。
产品侧，新模型被接入更多入口。MiMo Desktop桌面客户端正式版同步上线，订阅会员可使用Pro与Flash模型；UltraSpeed超高速模式宣称提供最高20倍输出速度。小米此前发起的邀测活动将在一周后结束，获邀用户切换模型名称后方可继续使用。
据小米方面介绍，MiMo-V2.6-Pro在提示与交互下参与金属有机框架材料筛选，用于吸附全氟和多氟烷基物质，将约一个月的研发周期压缩至两到三天；在Lean 4中协助完成Li-Yorke定理“周期三蕴含混沌”主定理的形式化，形成6000余行源码并通过内核核验。北京大学材料科学与工程学院特聘研究员窦锦虎评价，模型在该任务中展现的研究能力达到训练有素的博士研究人员水平。
高盛在研报中维持小米集团-W“买入”评级，12个月目标价39港元。该行预计，V2.6系列将巩固小米在代理编码与多模态整合上的定位，并提供更高的API定价潜力，同时可能与DeepSeek一道，继续为市场定价结构带来扰动。该行还预计，采用HySparse新架构的MiMo-V3可能在2027年初发布，稀疏比率由V2和V2.5系列的7:1提升至11:1，进一步推高效率前沿并压低推理成本。
对小米而言，MiMo的商业化账目已有雏形。据小米2026年二季度财报，智能电动汽车及AI等创新业务分部中，其他相关业务收入10亿元，同比增长56.50%，财报明确提及，该增长部分得益于MiMo大模型系列相关AI业务收入增加。

记者丨雷晨
编辑丨陶力 骆一帆
9月22日，小米发布并开源新一代MiMo大模型，包括全模态旗舰模型MiMo-V2.6-Pro和高效推理模型MiMo-V2.6-Flash，同时上线Pro版本的超高速模式V2.6-Pro-UltraSpeed和MiMo Desktop桌面客户端正式版，后者同步推出会员订阅方案。
第三方测评平台Artificial Analysis综合智能指数显示，MiMo-V2.6-Pro得分为46分，在当前开源权重模型中排名第一，超过了Kimi K3的44分和GLM-5.3的45分，也高于上一代MiMo-V2.5-Pro的26分。该榜单上，GPT-6 Astra和Claude Fable 5.1均为53分。
同一平台的智能指数单任务成本榜单显示，MiMo-V2.6-Pro单任务成本为0.13美元。小米方面称，同等智能水平下，该模型价格仅为海外模型的二十分之一至六十分之一，API定价沿用V2.5系列。
这次发布五日前，训练过程已经提前公开。9月17日凌晨，小米MiMo大模型团队负责人罗福莉在X平台发文，披露MiMo-V2.6正处于强化学习中间阶段，并上线实时训练页面，公开进度、Token消耗与成本数据。在国内大模型厂商中，将后训练环节以实时页面公开，此前尚无先例。
强化学习训练首度直播，小米六天花了347万美元
据小米方面披露，本轮强化学习的后训练耗时不到六天，Pro版本训练成本约262万美元，Flash版本约85万美元，各完成30步，累计约75万条轨迹。罗福莉在发文中称，这六天背后，是长达半年的基础研究积累和工程试错。训练中途，公开页面显示的数据是另一个量级。9月17日下午，两个版本累计成本已超过135万美元，每小时成本约3.1万美元。
成本曲线之外，页面同时披露了训练配置。罗福莉介绍，本次训练从三个方面扩展规模：算力上，采用大Batch与全异步架构，单次更新使用1568个样本，支持百万级上下文长度训练，单步训练Token达2.7B至3.7B；环境与工具上，构建覆盖代码、通用、视觉、安全等方向的多任务训练体系，并混合多个Harness框架运行；评估计算上，通过组内相对比较，为长程任务提供更精准、多样的奖励信号。
结果显示，训练任务平均通过率分别相对提升25%和12%。在样本外的长程软件工程评测基准DeepSWE v1.1中，Flash版本得分由48.8升至65.68，Pro版本由58.4升至72.57。罗福莉称，MiMo-V2.6可能是目前国产开源模型中投入算力最多的模型之一。
投行测算提供了另一个观察角度。高盛研报称，按avg@3口径，两个版本在DeepSWE基准最高取得67.86分和72.57分，Flash版本提升超过19分，Pro版本提升超过14分。成本折算上，Flash每百万Token约10美元，Pro约35美元，同等支出下Flash的分数增幅更高。该行估计，两个版本的训练分别基于约4000个和8000个H200等效GPU集群。直播过程中出现的中途干预包括基建错误重跑、不良模式数据集、零梯度任务与GPU显存不足。高盛认为，这意味着强化学习的瓶颈已经转向工程优化。
罗福莉在发文中将问题归结为“强化学习究竟能扩展到多远”。她表示，强化学习是模型自我提升路径中可扩展性较强的方向之一。小米将本次发布定义为探索RSI（递归自我改进）路径的关键一步。
开源是本次动作的另一面。除Pro与Flash模型权重及技术报告外，小米同步开放了蒸馏版本MiMo-V2.6-Distill-Qwen-9B及配套强化学习代码，包括7000余个高质量任务环境、端到端训练框架与轻量化Harness。小米方面表示，开放这些资源意在帮助研究者复现和验证相关结果。以该蒸馏模型为起点开展训练，SWE-bench Verified得分由61.1升至66.2，Terminal Bench 2.1得分由37.1升至52.8。
46分登顶开源榜，距全球最强模型仍有差距
46分之外，榜单给出了更完整的坐标。综合智能指数总榜上，排在MiMo-V2.6-Pro之前的是GPT-6 Astra、Claude Opus 5、Fable 5.1和Muse Spark 1.3四款闭源模型，小米是前五名中唯一的开源权重模型。
按小米方面的说法，在多数智能体评测中V2.6-Pro已比肩Claude Opus 5和GPT-5.6 Sol，在综合智能指数上与榜首仍有7分差距。
价格方面，单任务成本指标与榜单捆绑出现，指向的是大模型竞争的旧命题：同等智能水平下的成本下探。本次发布口径聚焦“价格不变、能力跃升”。上一代V2.5系列于今年4月以MIT协议开源，更早的V2系列随后于6月30日全面下线，开发者已完成迁移。不到半年再发新一代，小米模型迭代节奏仍在加快。
参数规模并非本次发布与前代的显著差异。小米方面称，MiMo-V2.6的预训练架构和参数规模与上一代保持一致，能力提升主要来自后训练环节。这一表述与五天前的直播相互印证：研发重心压在强化学习扩展上，而非继续堆叠参数。
产品侧，新模型被接入更多入口。MiMo Desktop桌面客户端正式版同步上线，订阅会员可使用Pro与Flash模型；UltraSpeed超高速模式宣称提供最高20倍输出速度。小米此前发起的邀测活动将在一周后结束，获邀用户切换模型名称后方可继续使用。
据小米方面介绍，MiMo-V2.6-Pro在提示与交互下参与金属有机框架材料筛选，用于吸附全氟和多氟烷基物质，将约一个月的研发周期压缩至两到三天；在Lean 4中协助完成Li-Yorke定理“周期三蕴含混沌”主定理的形式化，形成6000余行源码并通过内核核验。北京大学材料科学与工程学院特聘研究员窦锦虎评价，模型在该任务中展现的研究能力达到训练有素的博士研究人员水平。
高盛在研报中维持小米集团-W“买入”评级，12个月目标价39港元。该行预计，V2.6系列将巩固小米在代理编码与多模态整合上的定位，并提供更高的API定价潜力，同时可能与DeepSeek一道，继续为市场定价结构带来扰动。该行还预计，采用HySparse新架构的MiMo-V3可能在2027年初发布，稀疏比率由V2和V2.5系列的7:1提升至11:1，进一步推高效率前沿并压低推理成本。
对小米而言，MiMo的商业化账目已有雏形。据小米2026年二季度财报，智能电动汽车及AI等创新业务分部中，其他相关业务收入10亿元，同比增长56.50%，财报明确提及，该增长部分得益于MiMo大模型系列相关AI业务收入增加。

[Оригинал](https://cj.sina.com.cn/articles/view/1651428902/626ece2601901k3o8)