# “天才少女”罗福莉带队登顶开源榜，小米18 Pro系列率先搭载，为什么小米非要重金“砸出”自己的大模型？ - 新浪财经

*Источник: 新浪财经*
*Дата: 2026-09-23*
*Язык: zh*

**Кратко:** “天才少女”罗福莉带队登顶开源榜，小米18 Pro系列率先搭载，为什么小米非要重金“砸出”自己的大模型？
（来源：时代财经）
本文来源：时代财经 作者：赵姝婵 庞宇
9月23日晚，小米18 Pro系列正式发布。最受关注的AI能力，来自由Xiaomi MiMo大模型驱动的超级小爱2.0：它通过了首个全生态系统级智能体认证，支持一键记忆、自主思考、复杂执行，还能跨设备互通，在平板、PC上直接处理手机数据。
而支撑这款智能体的底座大模型MiMo，刚在前一天发布了最新版本。
9月22日，小米正式发布大模型MiMo-V2.6。据测评平台Artificial Analysis综合智能指数榜单显示，XiaomiMiMo-V2.6-Pro以46分的成绩登顶全球开源大模型第一、国产模型第一，得分超越Kimi-K3、Qwen3.8-Max。
MiMo大模型团队负责人罗福莉在社交平台上开启近12小时超长直播，全程展示模型强化学习和训练过程。
这款被官方称为“全球开源领域唯一全模态Pro模型”的背后，是一个加入小米不足一年的95后“天才科学家”和一场600亿的AI投入。通过采访多位行业专家、接近小米系企业的业内人士，结合罗福莉公开发言，时代财经试图回答一个问题：小米为什么非要重金砸出自研大模型？
低成本、全模态、全面开源
要理解这次登顶的意义，首先需要看懂 MiMo‑V2.6‑Pro 本身的产品、技术特性。
据小米官方资料，MiMo-V2.6 Pro是全球开源领域唯一的全模态Pro模型——能够同时处理文本、图片、视频和音频四种模态。在多个权威评测榜单中，Pro版在多项任务上达到或超越OpenAI、Google和Anthropic的同代模型水平。
更关键的是参数效率。训练报告显示，MiMo-V2.6在参数量与前代不变的前提下，实现了智能水平的代际跃升。也就是说，同样的“体量”，能力翻倍。
背后的原因是训练方法的改变。报告中Pro版的强化学习（RL）后训练仅用时6天，使用约75万条真实任务轨迹，总训练成本为347万美元，其中Flash版本为85万美元，Pro版本为262万美元，每天烧掉约400万元人民币。而同等性能水平的海外前沿模型通常需要20至60倍的成本投入。
同济大学电子与信息工程学院副教授李王明卉向时代财经表示，这个数字真正值得说的，不是“便宜”，而是它把大模型的强化学习后训练变成了“可计量的服务能力”。她指出，这个价格“能否持续”的答案不在预算，而在环境成本能不能被摊薄，“如果环境搭建、工具执行、结果验证的边际成本继续非线性上升，347万美元就只是一次漂亮的标杆；如果这些异构环境能被工程化、标准化、复用化，它就会变成一种新的服务定价范式。”
李王明卉所讨论的训练范式能否落地，很大程度取决于团队的工程与科研能力。而小米这套RL（强化学习）训练范式的主导者，正是加盟小米不足一年的罗福莉。
罗福莉的技术路线和半年答卷
近日，MiMo大模型团队负责人罗福莉在社交平台开启近12小时直播，完整对外展示模型强化学习的全过程，这也是她加入小米后，首次公开回应外界对MiMo大模型的技术关注。直播中她直言：“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”
公开资料显示，1995年出生的罗福莉，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言研究所计算语言学专业，后任职阿里巴巴达摩院算法专家、DeepSeek核心研究员。2025年11月正式加盟小米，全面负责MiMo大模型业务。外界将她称为“天才少女”，对于这个称呼，罗福莉曾在朋友圈坦言：“我不是天才少女，被捧得多高，摔得多重。”
强化学习路线正在被验证为有效路径。据公开信息，OpenAI在今年也大幅提升了RL在模型训练中的权重，这与罗福莉团队押注的技术方向一致。
罗福莉的公开帖文中提到，在开源模型阵营中，如果以计算量衡量，MiMo‑V2.6是规模最大的单次强化学习模型。在算力资源紧缺的现状下，几十人团队长期聚焦于强化学习方向，既需要科研信念，更离不开攻坚克难的勇气。该模型在训练中期挖掘潜力，再通过强化学习释放能力，最终登顶开源模型榜单。在她看来，MiMo‑V2.6背后的研究创新与工程难度，甚至超过自己曾参与部分工作的DeepSeek R1。
针对行业关注的MixRL（混合强化学习）与MOPD（多教师在线策略蒸馏）的技术路线之争，罗福莉解释二者并非对立。团队在代码、智能体等中等难度可验证任务上使用MixRL，收获了优异的泛化效果；而在长周期、高难度、难以核验的任务上，则单独训练后，再通过MOPD整合能力，避免拉低推演效率、产生过拟合。
她半开玩笑地提到，小米团队架构扁平，没有厚重的组织壁垒，落地MixRL的阻力很小，跨领域成员紧密协作，直面各类强化学习瓶颈，密集的每日研讨会议见证了模型能力的实时涌现。
生态越大，自研越贵，不做的代价更大
依靠这套强化学习的工程与科研能力，MiMo拿到了开源榜单的头部位置。但技术跑分之外，更值得讨论的问题是：对以硬件为根基的小米而言，为什么必须自研基础大模型，而不是直接采购第三方成熟模型？
核心答案或许藏在小米的全场景硬件生态与技术战略布局中。
到2026年，小米的业务版图已经覆盖手机、汽车、智能家居三大消费硬件生态。AI能力正在渗透到每一条产品线——从手机端的智能助手，到汽车端的智能座舱，再到智能家居的场景联动。如果这些产品的AI能力全部依赖外部模型，意味着小米把最关键的技术层交给了别人。
据公开数据，小米未来三年计划在AI相关业务投入不低于600亿元，这笔资金将投向AI全链条。今年7月，小米对AI相关业务完成一轮内部组织架构调整：AI技术链路被拆分为基座模型层、云端工程层、端侧能力层；其中基座模型层由MiMo团队负责，端侧能力下沉到手机、汽车等各终端业务线。调整的核心逻辑，是将基础模型打造为集团统一AI底座，向全集团各产品线输出AI能力。
一位接近小米生态链企业的人士向时代财经透露，在MiMo-V2.6发布之前，金山云、金山办公等雷军相关企业已在密切关注小米模型的进展。“这些企业本身就有大量的AI调用需求，现在采取多模型模式，但MiMo模型一旦成熟，token消耗量自然是能起来的。”随着小米自有大模型逐步走向商用，“生态内优先适配MiMo，是大概率的事”。
同济大学电子与信息工程学院副教授李王明卉告诉时代财经， MiMo-V2.6开源的核心价值，不在于公开模型权重，而是对外释放了一套完整的硬件适配运行体系。
“小米把手机、车机、家居设备在算力、时延、连接质量、传感器噪声上的巨大差异，一并暴露给了训练系统。”在她看来，小米庞大的终端生态是一座天然的异构RL环境生成器，让模型跳出理想实验室环境的最优解，学会在存在网络抖动、设备断连等突发状况的真实场景中稳定完成任务，这也是MiMo模型实用性突出的原因。
不过，优秀的数据并不等同于终局。深耕大模型领域的从业者刘文松（化名）告诉时代财经，在亮眼的开源成绩之下，小米大模型的发展仍面临不容忽视的行业风险与挑战。
首先，榜单跑分第一不等同于实际体验最优，评测数据与真实用户场景体验存在明显差距。多位业内人士坦言，在超长链路逻辑推理、复杂专业运算等高阶任务中，GPT-5、Claude4.5等闭源顶级模型依旧保持绝对领先优势，MiMo的综合能力仍有追赶空间。
其次，行业技术竞争日趋白热化，国内MiniMax、智谱、月之暗面等头部AI企业均在加码强化学习技术，纷纷对标前沿RL赛道，小米当前的差异化技术优势窗口期正在不断缩短，能否持续维持技术领先性仍未可知。
李王明卉也表示，从分布式调度的角度看，中国AI公司在算力利用率上的提升空间，在于让分散、异构、跨域的算力在调度器眼里不再被当成同质资源。她指出，当前很多调度器的隐含假设是“GPU小时等价”，但同样一块GPU在不同场景下的有效产出可能差出数倍，调度目标应从“最小化完成时间”转向“最大化有效算力价值”。
罗福莉说，她想知道“强化学习到底可以走多远”。刘文松认为，这个问题，或许现在是小米自己的问题。347万美元、6天训练，换来了全球开源第一的入场券。但入场券也只是开始，从“评测第一”走到“用户觉得好用”，从“开源领先”走到“商业闭环”的路还有很长。

“天才少女”罗福莉带队登顶开源榜，小米18 Pro系列率先搭载，为什么小米非要重金“砸出”自己的大模型？
（来源：时代财经）
本文来源：时代财经 作者：赵姝婵 庞宇
9月23日晚，小米18 Pro系列正式发布。最受关注的AI能力，来自由Xiaomi MiMo大模型驱动的超级小爱2.0：它通过了首个全生态系统级智能体认证，支持一键记忆、自主思考、复杂执行，还能跨设备互通，在平板、PC上直接处理手机数据。
而支撑这款智能体的底座大模型MiMo，刚在前一天发布了最新版本。
9月22日，小米正式发布大模型MiMo-V2.6。据测评平台Artificial Analysis综合智能指数榜单显示，XiaomiMiMo-V2.6-Pro以46分的成绩登顶全球开源大模型第一、国产模型第一，得分超越Kimi-K3、Qwen3.8-Max。
MiMo大模型团队负责人罗福莉在社交平台上开启近12小时超长直播，全程展示模型强化学习和训练过程。
这款被官方称为“全球开源领域唯一全模态Pro模型”的背后，是一个加入小米不足一年的95后“天才科学家”和一场600亿的AI投入。通过采访多位行业专家、接近小米系企业的业内人士，结合罗福莉公开发言，时代财经试图回答一个问题：小米为什么非要重金砸出自研大模型？
低成本、全模态、全面开源
要理解这次登顶的意义，首先需要看懂 MiMo‑V2.6‑Pro 本身的产品、技术特性。
据小米官方资料，MiMo-V2.6 Pro是全球开源领域唯一的全模态Pro模型——能够同时处理文本、图片、视频和音频四种模态。在多个权威评测榜单中，Pro版在多项任务上达到或超越OpenAI、Google和Anthropic的同代模型水平。
更关键的是参数效率。训练报告显示，MiMo-V2.6在参数量与前代不变的前提下，实现了智能水平的代际跃升。也就是说，同样的“体量”，能力翻倍。
背后的原因是训练方法的改变。报告中Pro版的强化学习（RL）后训练仅用时6天，使用约75万条真实任务轨迹，总训练成本为347万美元，其中Flash版本为85万美元，Pro版本为262万美元，每天烧掉约400万元人民币。而同等性能水平的海外前沿模型通常需要20至60倍的成本投入。
同济大学电子与信息工程学院副教授李王明卉向时代财经表示，这个数字真正值得说的，不是“便宜”，而是它把大模型的强化学习后训练变成了“可计量的服务能力”。她指出，这个价格“能否持续”的答案不在预算，而在环境成本能不能被摊薄，“如果环境搭建、工具执行、结果验证的边际成本继续非线性上升，347万美元就只是一次漂亮的标杆；如果这些异构环境能被工程化、标准化、复用化，它就会变成一种新的服务定价范式。”
李王明卉所讨论的训练范式能否落地，很大程度取决于团队的工程与科研能力。而小米这套RL（强化学习）训练范式的主导者，正是加盟小米不足一年的罗福莉。
罗福莉的技术路线和半年答卷
近日，MiMo大模型团队负责人罗福莉在社交平台开启近12小时直播，完整对外展示模型强化学习的全过程，这也是她加入小米后，首次公开回应外界对MiMo大模型的技术关注。直播中她直言：“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”
公开资料显示，1995年出生的罗福莉，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言研究所计算语言学专业，后任职阿里巴巴达摩院算法专家、DeepSeek核心研究员。2025年11月正式加盟小米，全面负责MiMo大模型业务。外界将她称为“天才少女”，对于这个称呼，罗福莉曾在朋友圈坦言：“我不是天才少女，被捧得多高，摔得多重。”
强化学习路线正在被验证为有效路径。据公开信息，OpenAI在今年也大幅提升了RL在模型训练中的权重，这与罗福莉团队押注的技术方向一致。
罗福莉的公开帖文中提到，在开源模型阵营中，如果以计算量衡量，MiMo‑V2.6是规模最大的单次强化学习模型。在算力资源紧缺的现状下，几十人团队长期聚焦于强化学习方向，既需要科研信念，更离不开攻坚克难的勇气。该模型在训练中期挖掘潜力，再通过强化学习释放能力，最终登顶开源模型榜单。在她看来，MiMo‑V2.6背后的研究创新与工程难度，甚至超过自己曾参与部分工作的DeepSeek R1。
针对行业关注的MixRL（混合强化学习）与MOPD（多教师在线策略蒸馏）的技术路线之争，罗福莉解释二者并非对立。团队在代码、智能体等中等难度可验证任务上使用MixRL，收获了优异的泛化效果；而在长周期、高难度、难以核验的任务上，则单独训练后，再通过MOPD整合能力，避免拉低推演效率、产生过拟合。
她半开玩笑地提到，小米团队架构扁平，没有厚重的组织壁垒，落地MixRL的阻力很小，跨领域成员紧密协作，直面各类强化学习瓶颈，密集的每日研讨会议见证了模型能力的实时涌现。
生态越大，自研越贵，不做的代价更大
依靠这套强化学习的工程与科研能力，MiMo拿到了开源榜单的头部位置。但技术跑分之外，更值得讨论的问题是：对以硬件为根基的小米而言，为什么必须自研基础大模型，而不是直接采购第三方成熟模型？
核心答案或许藏在小米的全场景硬件生态与技术战略布局中。
到2026年，小米的业务版图已经覆盖手机、汽车、智能家居三大消费硬件生态。AI能力正在渗透到每一条产品线——从手机端的智能助手，到汽车端的智能座舱，再到智能家居的场景联动。如果这些产品的AI能力全部依赖外部模型，意味着小米把最关键的技术层交给了别人。
据公开数据，小米未来三年计划在AI相关业务投入不低于600亿元，这笔资金将投向AI全链条。今年7月，小米对AI相关业务完成一轮内部组织架构调整：AI技术链路被拆分为基座模型层、云端工程层、端侧能力层；其中基座模型层由MiMo团队负责，端侧能力下沉到手机、汽车等各终端业务线。调整的核心逻辑，是将基础模型打造为集团统一AI底座，向全集团各产品线输出AI能力。
一位接近小米生态链企业的人士向时代财经透露，在MiMo-V2.6发布之前，金山云、金山办公等雷军相关企业已在密切关注小米模型的进展。“这些企业本身就有大量的AI调用需求，现在采取多模型模式，但MiMo模型一旦成熟，token消耗量自然是能起来的。”随着小米自有大模型逐步走向商用，“生态内优先适配MiMo，是大概率的事”。
同济大学电子与信息工程学院副教授李王明卉告诉时代财经， MiMo-V2.6开源的核心价值，不在于公开模型权重，而是对外释放了一套完整的硬件适配运行体系。
“小米把手机、车机、家居设备在算力、时延、连接质量、传感器噪声上的巨大差异，一并暴露给了训练系统。”在她看来，小米庞大的终端生态是一座天然的异构RL环境生成器，让模型跳出理想实验室环境的最优解，学会在存在网络抖动、设备断连等突发状况的真实场景中稳定完成任务，这也是MiMo模型实用性突出的原因。
不过，优秀的数据并不等同于终局。深耕大模型领域的从业者刘文松（化名）告诉时代财经，在亮眼的开源成绩之下，小米大模型的发展仍面临不容忽视的行业风险与挑战。
首先，榜单跑分第一不等同于实际体验最优，评测数据与真实用户场景体验存在明显差距。多位业内人士坦言，在超长链路逻辑推理、复杂专业运算等高阶任务中，GPT-5、Claude4.5等闭源顶级模型依旧保持绝对领先优势，MiMo的综合能力仍有追赶空间。
其次，行业技术竞争日趋白热化，国内MiniMax、智谱、月之暗面等头部AI企业均在加码强化学习技术，纷纷对标前沿RL赛道，小米当前的差异化技术优势窗口期正在不断缩短，能否持续维持技术领先性仍未可知。
李王明卉也表示，从分布式调度的角度看，中国AI公司在算力利用率上的提升空间，在于让分散、异构、跨域的算力在调度器眼里不再被当成同质资源。她指出，当前很多调度器的隐含假设是“GPU小时等价”，但同样一块GPU在不同场景下的有效产出可能差出数倍，调度目标应从“最小化完成时间”转向“最大化有效算力价值”。
罗福莉说，她想知道“强化学习到底可以走多远”。刘文松认为，这个问题，或许现在是小米自己的问题。347万美元、6天训练，换来了全球开源第一的入场券。但入场券也只是开始，从“评测第一”走到“用户觉得好用”，从“开源领先”走到“商业闭环”的路还有很长。

[Оригинал](https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisvqcx5317203.d.html?oid=800&vt=4&cid=76993&node_id=76993)