{"id":84465,"topic":"ai","source":"36 Kr","title":"每小时“烧钱”超20万元，罗福莉直播小米大模型训练 - 36 Kr","url":"https://www.36kr.com/p/3987267726523140","url_hash":"dc499579a49c463e6353e40fc385bfee053f3487","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiUEFVX3lxTFBINmpXRVVERUZjMHFPV0M0dV93QUFGUU9wUmU3MTdzTjZSb0x0b053STYwX0NJWW9Ic203dnNpem5oSkRudGhubEc1c0FHOF9n?oc=5\" target=\"_blank\">每小时“烧钱”超20万元，罗福莉直播小米大模型训练</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">36 Kr</font>","content":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了MiMo-V2.6的实时训练页面，让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本，具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。\n  截至17日下午界面新闻发稿，两个版本累计训练成本超过135万美元，其中MiMo-V2.6-Pro时长为1天21个小时，耗费超93万美元，平均每小时耗费超2万美元；MiMo-V2.6-Flash训练时长1天16小时，耗费超42万美元，平均每小时耗费超1万美元。\n  综合计算，两个版本训练合计每小时花费约3.1万美元，折合人民币超20万元。\n  01\n  罗福莉1995年出生于四川宜宾，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间，她于2019年在人工智能领域顶级国际会议ACL上发表了8篇论文，其中2篇为第一作者。\n  她的职业生涯始于阿里巴巴达摩院，她主导开发了多语言预训练模型VECO，并推动了AliceMind的开源工作。2022年，罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作，后又担任DeepSeek的深度学习研究员，参与研发DeepSeek-V2等模型。\n  去年11月，罗福莉官宣加入小米公司。她在朋友圈发文称：“智能终将从语言迈向物理世界。我正在Xiaomi MiMo，和一群富有创造力、才华横溢且真诚热爱的研究员，致力于构建这样的未来，全力奔赴我们心目中的AGI。”据悉，Xiaomi MiMo是小米首个推理大模型。\n  一个月后，身为MiMo大模型负责人的罗福莉完成加入小米后的首秀。她在小米“人车家全生态”合作伙伴大会上，介绍了小米大模型的具体情况，并谈及自己对AI的相关看法。\n  她在活动中指出，下一代智能体系统核心围绕Agent执行与Omni（全能）感知，涵盖记忆、推理、自主规划、决策、执行多个维度，应当从回答问题走向完成任务，并且应当统一多模态感知，为理解物理世界打基础。 \n  今年3月，罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛，谈起当时火热的OpenClaw（龙虾），罗福莉将其当做一种AI框架的革命性与颠覆性事件看待，并且因为是开源，有利于整个社区参与深度改进。“另外从技术角度来说，它保证了模型下限，同时又拉升了上限，在绝大部分场景，它的任务完成度已经非常接近Claude最新模型。” \n  罗福莉还表示，在接下来一年里，AGI进程中最关键的一件事是“自进化”。 她认为，借助强大的模型与Agent框架，在可验证的约束条件下让模型持续迭代优化，模型便能自主学习和进化，拿出更优方案。她预测，未来一到两年内，大模型叠加自进化框架，将对科学研究带来指数级加速，这并不仅仅是替代人力，而是让AI像顶尖科学家一样探索未知。\n  02\n  小米也在3月推出Xiaomi MiMo-V2-Pro、Xiaomi MiMo-V2-Omni与Xiaomi MiMo-V2-TTS三款自研大模型。\n  三款模型中，MiMo-V2-Pro是旗舰文本基座，专为高强度Agent工作场景而生，主打推理、规划与工具调用。MiMo-V2-Omni是全模态Agent基座，原生融合文本、视觉与音频感知，打通从理解到执行的完整链路。MiMo-V2-TTS是语音合成大模型，目标是为 Agent 赋予有温度、有情感的声音表达能力，构成全栈的最后一环。\n  其中，MiMo-V2-Pro作为旗舰基座模型，专为Agent场景深度优化，针对复杂多样的智能体架构进行了监督微调和强化学习，具备更强工具调用与多步推理能力，并最终交付结果。从架构上看，该模型总参数规模突破1万亿（1T），其中激活参数为42B，采用改进后的混合注意力机制（Hybrid Attention），在保证推理效率的同时大幅提升模型容量。其上下文窗口进一步扩展至100万Token，可以支持超长任务链和复杂工作流。\n  同步亮相的MiMo-V2-Omni与MiMo-V2-TTS，则补齐了感知与表达的两块拼图。前者的核心价值在于实现了音频、图像、视频的对齐。后者支持细粒度控制的情感表达引擎，让Agent具备了更接近人类的表达能力。\n  小米创始人雷军在社交平台发文表示：“在AI领域，我们今年的研发和资本投入就将超过160亿元。”他还介绍，大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上，位列全球第八。按大模型品牌来排名，排在全球第五，超过了xAlGrok。\n  本文来自微信公众号“界面新闻”，作者：沈霄戈，36氪经授权发布。","image_url":"https://img.36krcdn.com/hsossms/20260917/v2_8f8fa0172dd44ce28aa374a0360ae3ef@5888275@ai_oswg824547oswg1053oswg495_img_png~tplv-1marlgjv7f-ai-v3:600:400:600:400:q70.jpg","lang":"zh","published_at":"2026-09-17T10:12:21+00:00","fetched_at":"2026-09-17T10:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了MiMo-V2.6的实时训练页面，让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本，具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。\n  截至17日下午界面新闻发稿，两个版本累计训练成本超过135万美元，其中MiMo-V2.6-Pro时长为1天21个小时，耗费超93万美元，平均每小时耗费超2万美元；MiMo-V2.6-Flash训练时长1天16小时，耗费超42万美元，平均每小时耗费超1万美元。\n  综合计算，两个版本训练合计每小时花费约3.1万美元，折合人民币超20万元。\n  01\n  罗福莉1995年出生于四川宜宾，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间，她于2019年在人工智能领域顶级国际会议ACL上发表了8篇论文，其中2篇为第一作者。\n  她的职业生涯始于阿里巴巴达摩院，她主导开发了多语言预训练模型VECO，并推动了AliceMind的开源工作。2022年，罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作，后又担任DeepSeek的深度学习研究员，参与研发DeepSeek-V2等模型。\n  去年11月，罗福莉官宣加入小米公司。她在朋友圈发文称：“智能终将从语言迈向物理世界。我正在Xiaomi MiMo，和一群富有创造力、才华横溢且真诚热爱的研究员，致力于构建这样的未来，全力奔赴我们心目中的AGI。”据悉，Xiaomi MiMo是小米首个推理大模型。\n  一个月后，身为MiMo大模型负责人的罗福莉完成加入小米后的首秀。她在小米“人车家全生态”合作伙伴大会上，介绍了小米大模型的具体情况，并谈及自己对AI的相关看法。\n  她在活动中指出，下一代智能体系统核心围绕Agent执行与Omni（全能）感知，涵盖记忆、推理、自主规划、决策、执行多个维度，应当从回答问题走向完成任务，并且应当统一多模态感知，为理解物理世界打基础。 \n  今年3月，罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛，谈起当时火热的OpenClaw（龙虾），罗福莉将其当做一种AI框架的革命性与颠覆性事件看待，并且因为是开源，有利于整个社区参与深度改进。“另外从技术角度来说，它保证了模型下限，同时又拉升了上限，在绝大部分场景，它的任务完成度已经非常接近Claude最新模型。” \n  罗福莉还表示，在接下来一年里，AGI进程中最关键的一件事是“自进化”。 她认为，借助强大的模型与Agent框架，在可验证的约束条件下让模型持续迭代优化，模型便能自主学习和进化，拿出更优方案。她预测，未来一到两年内，大模型叠加自进化框架，将对科学研究带来指数级加速，这并不仅仅是替代人力，而是让AI像顶尖科学家一样探索未知。\n  02\n  小米也在3月推出Xiaomi MiMo-V2-Pro、Xiaomi MiMo-V2-Omni与Xiaomi MiMo-V2-TTS三款自研大模型。\n  三款模型中，MiMo-V2-Pro是旗舰文本基座，专为高强度Agent工作场景而生，主打推理、规划与工具调用。MiMo-V2-Omni是全模态Agent基座，原生融合文本、视觉与音频感知，打通从理解到执行的完整链路。MiMo-V2-TTS是语音合成大模型，目标是为 Agent 赋予有温度、有情感的声音表达能力，构成全栈的最后一环。\n  其中，MiMo-V2-Pro作为旗舰基座模型，专为Agent场景深度优化，针对复杂多样的智能体架构进行了监督微调和强化学习，具备更强工具调用与多步推理能力，并最终交付结果。从架构上看，该模型总参数规模突破1万亿（1T），其中激活参数为42B，采用改进后的混合注意力机制（Hybrid Attention），在保证推理效率的同时大幅提升模型容量。其上下文窗口进一步扩展至100万Token，可以支持超长任务链和复杂工作流。\n  同步亮相的MiMo-V2-Omni与MiMo-V2-TTS，则补齐了感知与表达的两块拼图。前者的核心价值在于实现了音频、图像、视频的对齐。后者支持细粒度控制的情感表达引擎，让Agent具备了更接近人类的表达能力。\n  小米创始人雷军在社交平台发文表示：“在AI领域，我们今年的研发和资本投入就将超过160亿元。”他还介绍，大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上，位列全球第八。按大模型品牌来排名，排在全球第五，超过了xAlGrok。\n  本文来自微信公众号“界面新闻”，作者：沈霄戈，36氪经授权发布。","cluster_id":3490915,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.36kr.com/p/3987267726523140","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2254 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2254,"summary_length":2254,"usable_text_length":2254,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2254,"summary_length":2254}},"news_item":{"id":84465,"canonical_url":"https://www.36kr.com/p/3987267726523140","source_url":"https://www.36kr.com/p/3987267726523140","title":"每小时“烧钱”超20万元，罗福莉直播小米大模型训练 - 36 Kr","source_name":"36 Kr","author":null,"published_at":"2026-09-17T10:12:21+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiUEFVX3lxTFBINmpXRVVERUZjMHFPV0M0dV93QUFGUU9wUmU3MTdzTjZSb0x0b053STYwX0NJWW9Ic203dnNpem5oSkRudGhubEc1c0FHOF9n?oc=5\" target=\"_blank\">每小时“烧钱”超20万元，罗福莉直播小米大模型训练</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">36 Kr</font>","full_text":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了MiMo-V2.6的实时训练页面，让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本，具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。\n  截至17日下午界面新闻发稿，两个版本累计训练成本超过135万美元，其中MiMo-V2.6-Pro时长为1天21个小时，耗费超93万美元，平均每小时耗费超2万美元；MiMo-V2.6-Flash训练时长1天16小时，耗费超42万美元，平均每小时耗费超1万美元。\n  综合计算，两个版本训练合计每小时花费约3.1万美元，折合人民币超20万元。\n  01\n  罗福莉1995年出生于四川宜宾，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间，她于2019年在人工智能领域顶级国际会议ACL上发表了8篇论文，其中2篇为第一作者。\n  她的职业生涯始于阿里巴巴达摩院，她主导开发了多语言预训练模型VECO，并推动了AliceMind的开源工作。2022年，罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作，后又担任DeepSeek的深度学习研究员，参与研发DeepSeek-V2等模型。\n  去年11月，罗福莉官宣加入小米公司。她在朋友圈发文称：“智能终将从语言迈向物理世界。我正在Xiaomi MiMo，和一群富有创造力、才华横溢且真诚热爱的研究员，致力于构建这样的未来，全力奔赴我们心目中的AGI。”据悉，Xiaomi MiMo是小米首个推理大模型。\n  一个月后，身为MiMo大模型负责人的罗福莉完成加入小米后的首秀。她在小米“人车家全生态”合作伙伴大会上，介绍了小米大模型的具体情况，并谈及自己对AI的相关看法。\n  她在活动中指出，下一代智能体系统核心围绕Agent执行与Omni（全能）感知，涵盖记忆、推理、自主规划、决策、执行多个维度，应当从回答问题走向完成任务，并且应当统一多模态感知，为理解物理世界打基础。 \n  今年3月，罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛，谈起当时火热的OpenClaw（龙虾），罗福莉将其当做一种AI框架的革命性与颠覆性事件看待，并且因为是开源，有利于整个社区参与深度改进。“另外从技术角度来说，它保证了模型下限，同时又拉升了上限，在绝大部分场景，它的任务完成度已经非常接近Claude最新模型。” \n  罗福莉还表示，在接下来一年里，AGI进程中最关键的一件事是“自进化”。 她认为，借助强大的模型与Agent框架，在可验证的约束条件下让模型持续迭代优化，模型便能自主学习和进化，拿出更优方案。她预测，未来一到两年内，大模型叠加自进化框架，将对科学研究带来指数级加速，这并不仅仅是替代人力，而是让AI像顶尖科学家一样探索未知。\n  02\n  小米也在3月推出Xiaomi MiMo-V2-Pro、Xiaomi MiMo-V2-Omni与Xiaomi MiMo-V2-TTS三款自研大模型。\n  三款模型中，MiMo-V2-Pro是旗舰文本基座，专为高强度Agent工作场景而生，主打推理、规划与工具调用。MiMo-V2-Omni是全模态Agent基座，原生融合文本、视觉与音频感知，打通从理解到执行的完整链路。MiMo-V2-TTS是语音合成大模型，目标是为 Agent 赋予有温度、有情感的声音表达能力，构成全栈的最后一环。\n  其中，MiMo-V2-Pro作为旗舰基座模型，专为Agent场景深度优化，针对复杂多样的智能体架构进行了监督微调和强化学习，具备更强工具调用与多步推理能力，并最终交付结果。从架构上看，该模型总参数规模突破1万亿（1T），其中激活参数为42B，采用改进后的混合注意力机制（Hybrid Attention），在保证推理效率的同时大幅提升模型容量。其上下文窗口进一步扩展至100万Token，可以支持超长任务链和复杂工作流。\n  同步亮相的MiMo-V2-Omni与MiMo-V2-TTS，则补齐了感知与表达的两块拼图。前者的核心价值在于实现了音频、图像、视频的对齐。后者支持细粒度控制的情感表达引擎，让Agent具备了更接近人类的表达能力。\n  小米创始人雷军在社交平台发文表示：“在AI领域，我们今年的研发和资本投入就将超过160亿元。”他还介绍，大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上，位列全球第八。按大模型品牌来排名，排在全球第五，超过了xAlGrok。\n  本文来自微信公众号“界面新闻”，作者：沈霄戈，36氪经授权发布。","excerpt":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了MiMo-V2.6的实时训练页面，让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本，具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。\n  截至17日下午界面新闻发稿，两个版本累计训练成本超过135万美元，其中MiMo-V2.6-Pro时长为1天21个小时，耗费超93万美元，平均每小时耗费超2万美元；MiMo-V2.6-Flash训练时长1天16小时，耗费超42万美元，平均每小时耗费超1万美元。\n  综合计算，两个版本训练合计每小时花费约3.1万美元，折合人民币超20万元。\n  01\n  罗福莉1995年出生于四川宜宾，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间，她于2019年在人工智能领域顶级国际会议ACL上发表了8篇论文，其中2篇为第一作者。\n  她的职业生涯始于阿里巴巴达摩院，她主导开发了多语言预训练模型VECO，并推动了AliceMind的开源工作。2022年，罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作，后又担任DeepSeek的深度学习研究员，参与研发DeepSeek-V2等模型。\n  去年11月，罗福莉官宣加入小米公司。她在朋友圈发文称：“智能终将从语言迈向物理世界。我正在Xiaomi MiMo，和一群富有创造力、才华横溢且真诚热爱的研究员，致力于构建这样的未来，全力奔赴我们心目中的AGI。”据悉，Xiaomi MiMo是小米首个推理大模型。\n  一个月后，身为MiMo大模型负责人的罗福莉完成加入小米后的首秀。她在小米“人车家全生态”合作伙伴大会上，介绍了小米大模型的具体情况，并谈及自己对AI的相关看法。\n  她在活动中指出，下一代智能体系统核心围绕Agent执行与Omni（全能）感知，涵盖记忆、推理、自主规划、决策、执行多个维度，应当从回答问题走向完成任务，并且应当统一多模态感知，为理解物理世界打基础。 \n  今年3月，罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛，谈起当时火热的OpenClaw（龙虾），罗福莉将其当做一种AI框架的革命性与颠覆性事件看待，并且因为是开源，有利于整个社区参与深度改进。“另外从技术角度来说，它保证了模型下限，同时又拉升了上限，在绝大部分场景，它的任务完成度已经非常接近Claude最新模型。” \n  罗福莉还表示，在接下来一年里，AGI进程中最关键的一件事是“自进化”。 她认为，借助强大的模型与Agent框架，在可验证的约束条件下让模型持续迭代优化，模型便能自主学习和进化，拿出更优方案。她预测，未来一到两年内，大模型叠加自进化框架，将对科学研究带来指数级加速，这并不仅仅是替代人力，而是让AI像顶尖科学家一样探索未知。\n  02\n  小米也在3月推出Xiaomi MiMo-V2-Pro、Xiaomi MiMo-V2-Omni与Xiaomi MiMo-V2-TTS三款自研大模型。\n  三款模型中，MiMo-V2-Pro是旗舰文本基座，专为高强度Agent工作场景而生，主打推理、规划与工具调用。MiMo-V2-Omni是全模态Agent基座，原生融合文本、视觉与音频感知，打通从理解到执行的完整链路。MiMo-V2-TTS是语音合成大模型，目标是为 Agent 赋予有温度、有情感的声音表达能力，构成全栈的最后一环。\n  其中，MiMo-V2-Pro作为旗舰基座模型，专为Agent场景深度优化，针对复杂多样的智能体架构进行了监督微调和强化学习，具备更强工具调用与多步推理能力，并最终交付结果。从架构上看，该模型总参数规模突破1万亿（1T），其中激活参数为42B，采用改进后的混合注意力机制（Hybrid Attention），在保证推理效率的同时大幅提升模型容量。其上下文窗口进一步扩展至100万Token，可以支持超长任务链和复杂工作流。\n  同步亮相的MiMo-V2-Omni与MiMo-V2-TTS，则补齐了感知与表达的两块拼图。前者的核心价值在于实现了音频、图像、视频的对齐。后者支持细粒度控制的情感表达引擎，让Agent具备了更接近人类的表达能力。\n  小米创始人雷军在社交平台发文表示：“在AI领域，我们今年的研发和资本投入就将超过160亿元。”他还介绍，大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上，位列全球第八。按大模型品牌来排名，排在全球第五，超过了xAlGrok。\n  本文来自微信公众号“界面新闻”，作者：沈霄戈，36氪经授权发布。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2254 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.36kr.com/p/3987267726523140","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2254 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2254,"summary_length":2254,"usable_text_length":2254,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2254,"summary_length":2254}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"每小时“烧钱”超20万元，罗福莉直播小米大模型训练 - 36 Kr","url":"https://www.36kr.com/p/3987267726523140","summary":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了MiMo-V2.6的实时训练页面，让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本，具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。\n  截至17日下午界面新闻发稿，两个版本累计训练成本超过135万美元，其中MiMo-V2.6-Pro时长为1天21个小时，耗费超93万美元，平均每小时耗费超2万美元；MiMo-V2.6-Flash训练时长1天16小时，耗费超42万美元，平均每小时耗费超1万美元。\n  综合计算，两个版本训练合计每小时花费约3.1万美元，折合人民币超20万元。\n  01\n  罗福莉1995年出生于四川宜宾，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间，她于2019年在人工智能领域顶级国际会议ACL上发表了8篇论文，其中2篇为第一作者。\n  她的职业生涯始于阿里巴巴达摩院，她主导开发了多语言预训练模型VECO，并推动了AliceMind的开源工作。2022年，罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作，后又担任DeepSeek的深度学习研究员，参与研发DeepSeek-V2等模型。\n  去年11月，罗福莉官宣加入小米公司。她在朋友圈发文称：“智能终将从语言迈向物理世界。我正在Xiaomi MiMo，和一群富有创造力、才华横溢且真诚热爱的研究员，致力于构建这样的未来，全力奔赴我们心目中的AGI。”据悉，Xiaomi MiMo是小米首个推理大模型。\n  一个月后，身为MiMo大模型负责人的罗福莉完成加入小米后的首秀。她在小米“人车家全生态”合作伙伴大会上，介绍了小米大模型的具体情况，并谈及自己对AI的相关看法。\n  她在活动中指出，下一代智能体系统核心围绕Agent执行与Omni（全能）感知，涵盖记忆、推理、自主规划、决策、执行多个维度，应当从回答问题走向完成任务，并且应当统一多模态感知，为理解物理世界打基础。 \n  今年3月，罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛，谈起当时火热的OpenClaw（龙虾），罗福莉将其当做一种AI框架的革命性与颠覆性事件看待，并且因为是开源，有利于整个社区参与深度改进。“另外从技术角度来说，它保证了模型下限，同时又拉升了上限，在绝大部分场景，它的任务完成度已经非常接近Claude最新模型。” \n  罗福莉还表示，在接下来一年里，AGI进程中最关键的一件事是“自进化”。 她认为，借助强大的模型与Agent框架，在可验证的约束条件下让模型持续迭代优化，模型便能自主学习和进化，拿出更优方案。她预测，未来一到两年内，大模型叠加自进化框架，将对科学研究带来指数级加速，这并不仅仅是替代人力，而是让AI像顶尖科学家一样探索未知。\n  02\n  小米也在3月推出Xiaomi MiMo-V2-Pro、Xiaomi MiMo-V2-Omni与Xiaomi MiMo-V2-TTS三款自研大模型。\n  三款模型中，MiMo-V2-Pro是旗舰文本基座，专为高强度Agent工作场景而生，主打推理、规划与工具调用。MiMo-V2-Omni是全模态Agent基座，原生融合文本、视觉与音频感知，打通从理解到执行的完整链路。MiMo-V2-TTS是语音合成大模型，目标是为 Agent 赋予有温度、有情感的声音表达能力，构成全栈的最后一环。\n  其中，MiMo-V2-Pro作为旗舰基座模型，专为Agent场景深度优化，针对复杂多样的智能体架构进行了监督微调和强化学习，具备更强工具调用与多步推理能力，并最终交付结果。从架构上看，该模型总参数规模突破1万亿（1T），其中激活参数为42B，采用改进后的混合注意力机制（Hybrid Attention），在保证推理效率的同时大幅提升模型容量。其上下文窗口进一步扩展至100万Token，可以支持超长任务链和复杂工作流。\n  同步亮相的MiMo-V2-Omni与MiMo-V2-TTS，则补齐了感知与表达的两块拼图。前者的核心价值在于实现了音频、图像、视频的对齐。后者支持细粒度控制的情感表达引擎，让Agent具备了更接近人类的表达能力。\n  小米创始人雷军在社交平台发文表示：“在AI领域，我们今年的研发和资本投入就将超过160亿元。”他还介绍，大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上，位列全球第八。按大模型品牌来排名，排在全球第五，超过了xAlGrok。\n  本文来自微信公众号“界面新闻”，作者：沈霄戈，36氪经授权发布。","source":"36 Kr","date":"2026-09-17T10:12:21+00:00","content":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了MiMo-V2.6的实时训练页面，让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本，具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。\n  截至17日下午界面新闻发稿，两个版本累计训练成本超过135万美元，其中MiMo-V2.6-Pro时长为1天21个小时，耗费超93万美元，平均每小时耗费超2万美元；MiMo-V2.6-Flash训练时长1天16小时，耗费超42万美元，平均每小时耗费超1万美元。\n  综合计算，两个版本训练合计每小时花费约3.1万美元，折合人民币超20万元。\n  01\n  罗福莉1995年出生于四川宜宾，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间，她于2019年在人工智能领域顶级国际会议ACL上发表了8篇论文，其中2篇为第一作者。\n  她的职业生涯始于阿里巴巴达摩院，她主导开发了多语言预训练模型VECO，并推动了AliceMind的开源工作。2022年，罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作，后又担任DeepSeek的深度学习研究员，参与研发DeepSeek-V2等模型。\n  去年11月，罗福莉官宣加入小米公司。她在朋友圈发文称：“智能终将从语言迈向物理世界。我正在Xiaomi MiMo，和一群富有创造力、才华横溢且真诚热爱的研究员，致力于构建这样的未来，全力奔赴我们心目中的AGI。”据悉，Xiaomi MiMo是小米首个推理大模型。\n  一个月后，身为MiMo大模型负责人的罗福莉完成加入小米后的首秀。她在小米“人车家全生态”合作伙伴大会上，介绍了小米大模型的具体情况，并谈及自己对AI的相关看法。\n  她在活动中指出，下一代智能体系统核心围绕Agent执行与Omni（全能）感知，涵盖记忆、推理、自主规划、决策、执行多个维度，应当从回答问题走向完成任务，并且应当统一多模态感知，为理解物理世界打基础。 \n  今年3月，罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛，谈起当时火热的OpenClaw（龙虾），罗福莉将其当做一种AI框架的革命性与颠覆性事件看待，并且因为是开源，有利于整个社区参与深度改进。“另外从技术角度来说，它保证了模型下限，同时又拉升了上限，在绝大部分场景，它的任务完成度已经非常接近Claude最新模型。” \n  罗福莉还表示，在接下来一年里，AGI进程中最关键的一件事是“自进化”。 她认为，借助强大的模型与Agent框架，在可验证的约束条件下让模型持续迭代优化，模型便能自主学习和进化，拿出更优方案。她预测，未来一到两年内，大模型叠加自进化框架，将对科学研究带来指数级加速，这并不仅仅是替代人力，而是让AI像顶尖科学家一样探索未知。\n  02\n  小米也在3月推出Xiaomi MiMo-V2-Pro、Xiaomi MiMo-V2-Omni与Xiaomi MiMo-V2-TTS三款自研大模型。\n  三款模型中，MiMo-V2-Pro是旗舰文本基座，专为高强度Agent工作场景而生，主打推理、规划与工具调用。MiMo-V2-Omni是全模态Agent基座，原生融合文本、视觉与音频感知，打通从理解到执行的完整链路。MiMo-V2-TTS是语音合成大模型，目标是为 Agent 赋予有温度、有情感的声音表达能力，构成全栈的最后一环。\n  其中，MiMo-V2-Pro作为旗舰基座模型，专为Agent场景深度优化，针对复杂多样的智能体架构进行了监督微调和强化学习，具备更强工具调用与多步推理能力，并最终交付结果。从架构上看，该模型总参数规模突破1万亿（1T），其中激活参数为42B，采用改进后的混合注意力机制（Hybrid Attention），在保证推理效率的同时大幅提升模型容量。其上下文窗口进一步扩展至100万Token，可以支持超长任务链和复杂工作流。\n  同步亮相的MiMo-V2-Omni与MiMo-V2-TTS，则补齐了感知与表达的两块拼图。前者的核心价值在于实现了音频、图像、视频的对齐。后者支持细粒度控制的情感表达引擎，让Agent具备了更接近人类的表达能力。\n  小米创始人雷军在社交平台发文表示：“在AI领域，我们今年的研发和资本投入就将超过160亿元。”他还介绍，大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上，位列全球第八。按大模型品牌来排名，排在全球第五，超过了xAlGrok。\n  本文来自微信公众号“界面新闻”，作者：沈霄戈，36氪经授权发布。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.36kr.com/p/3987267726523140","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2254 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2254 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2254,"summary_length":2254,"usable_text_length":2254,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2254,"summary_length":2254}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/84465","export_markdown":"/api/items/84465/export?format=markdown","export_json":"/api/items/84465/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.36kr.com/p/3987267726523140"},"formats":{"full":{"id":84465,"title":"每小时“烧钱”超20万元，罗福莉直播小米大模型训练 - 36 Kr","url":"https://www.36kr.com/p/3987267726523140","source":"36 Kr","author":null,"published_at":"2026-09-17T10:12:21+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了MiMo-V2.6的实时训练页面，让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本，具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。\n  截至17日下午界面新闻发稿，两个版本累计训练成本超过135万美元，其中MiMo-V2.6-Pro时长为1天21个小时，耗费超93万美元，平均每小时耗费超2万美元；MiMo-V2.6-Flash训练时长1天16小时，耗费超42万美元，平均每小时耗费超1万美元。\n  综合计算，两个版本训练合计每小时花费约3.1万美元，折合人民币超20万元。\n  01\n  罗福莉1995年出生于四川宜宾，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间，她于2019年在人工智能领域顶级国际会议ACL上发表了8篇论文，其中2篇为第一作者。\n  她的职业生涯始于阿里巴巴达摩院，她主导开发了多语言预训练模型VECO，并推动了AliceMind的开源工作。2022年，罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作，后又担任DeepSeek的深度学习研究员，参与研发DeepSeek-V2等模型。\n  去年11月，罗福莉官宣加入小米公司。她在朋友圈发文称：“智能终将从语言迈向物理世界。我正在Xiaomi MiMo，和一群富有创造力、才华横溢且真诚热爱的研究员，致力于构建这样的未来，全力奔赴我们心目中的AGI。”据悉，Xiaomi MiMo是小米首个推理大模型。\n  一个月后，身为MiMo大模型负责人的罗福莉完成加入小米后的首秀。她在小米“人车家全生态”合作伙伴大会上，介绍了小米大模型的具体情况，并谈及自己对AI的相关看法。\n  她在活动中指出，下一代智能体系统核心围绕Agent执行与Omni（全能）感知，涵盖记忆、推理、自主规划、决策、执行多个维度，应当从回答问题走向完成任务，并且应当统一多模态感知，为理解物理世界打基础。 \n  今年3月，罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛，谈起当时火热的OpenClaw（龙虾），罗福莉将其当做一种AI框架的革命性与颠覆性事件看待，并且因为是开源，有利于整个社区参与深度改进。“另外从技术角度来说，它保证了模型下限，同时又拉升了上限，在绝大部分场景，它的任务完成度已经非常接近Claude最新模型。” \n  罗福莉还表示，在接下来一年里，AGI进程中最关键的一件事是“自进化”。 她认为，借助强大的模型与Agent框架，在可验证的约束条件下让模型持续迭代优化，模型便能自主学习和进化，拿出更优方案。她预测，未来一到两年内，大模型叠加自进化框架，将对科学研究带来指数级加速，这并不仅仅是替代人力，而是让AI像顶尖科学家一样探索未知。\n  02\n  小米也在3月推出Xiaomi MiMo-V2-Pro、Xiaomi MiMo-V2-Omni与Xiaomi MiMo-V2-TTS三款自研大模型。\n  三款模型中，MiMo-V2-Pro是旗舰文本基座，专为高强度Agent工作场景而生，主打推理、规划与工具调用。MiMo-V2-Omni是全模态Agent基座，原生融合文本、视觉与音频感知，打通从理解到执行的完整链路。MiMo-V2-TTS是语音合成大模型，目标是为 Agent 赋予有温度、有情感的声音表达能力，构成全栈的最后一环。\n  其中，MiMo-V2-Pro作为旗舰基座模型，专为Agent场景深度优化，针对复杂多样的智能体架构进行了监督微调和强化学习，具备更强工具调用与多步推理能力，并最终交付结果。从架构上看，该模型总参数规模突破1万亿（1T），其中激活参数为42B，采用改进后的混合注意力机制（Hybrid Attention），在保证推理效率的同时大幅提升模型容量。其上下文窗口进一步扩展至100万Token，可以支持超长任务链和复杂工作流。\n  同步亮相的MiMo-V2-Omni与MiMo-V2-TTS，则补齐了感知与表达的两块拼图。前者的核心价值在于实现了音频、图像、视频的对齐。后者支持细粒度控制的情感表达引擎，让Agent具备了更接近人类的表达能力。\n  小米创始人雷军在社交平台发文表示：“在AI领域，我们今年的研发和资本投入就将超过160亿元。”他还介绍，大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上，位列全球第八。按大模型品牌来排名，排在全球第五，超过了xAlGrok。\n  本文来自微信公众号“界面新闻”，作者：沈霄戈，36氪经授权发布。","full_text":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了MiMo-V2.6的实时训练页面，让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本，具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。\n  截至17日下午界面新闻发稿，两个版本累计训练成本超过135万美元，其中MiMo-V2.6-Pro时长为1天21个小时，耗费超93万美元，平均每小时耗费超2万美元；MiMo-V2.6-Flash训练时长1天16小时，耗费超42万美元，平均每小时耗费超1万美元。\n  综合计算，两个版本训练合计每小时花费约3.1万美元，折合人民币超20万元。\n  01\n  罗福莉1995年出生于四川宜宾，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间，她于2019年在人工智能领域顶级国际会议ACL上发表了8篇论文，其中2篇为第一作者。\n  她的职业生涯始于阿里巴巴达摩院，她主导开发了多语言预训练模型VECO，并推动了AliceMind的开源工作。2022年，罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作，后又担任DeepSeek的深度学习研究员，参与研发DeepSeek-V2等模型。\n  去年11月，罗福莉官宣加入小米公司。她在朋友圈发文称：“智能终将从语言迈向物理世界。我正在Xiaomi MiMo，和一群富有创造力、才华横溢且真诚热爱的研究员，致力于构建这样的未来，全力奔赴我们心目中的AGI。”据悉，Xiaomi MiMo是小米首个推理大模型。\n  一个月后，身为MiMo大模型负责人的罗福莉完成加入小米后的首秀。她在小米“人车家全生态”合作伙伴大会上，介绍了小米大模型的具体情况，并谈及自己对AI的相关看法。\n  她在活动中指出，下一代智能体系统核心围绕Agent执行与Omni（全能）感知，涵盖记忆、推理、自主规划、决策、执行多个维度，应当从回答问题走向完成任务，并且应当统一多模态感知，为理解物理世界打基础。 \n  今年3月，罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛，谈起当时火热的OpenClaw（龙虾），罗福莉将其当做一种AI框架的革命性与颠覆性事件看待，并且因为是开源，有利于整个社区参与深度改进。“另外从技术角度来说，它保证了模型下限，同时又拉升了上限，在绝大部分场景，它的任务完成度已经非常接近Claude最新模型。” \n  罗福莉还表示，在接下来一年里，AGI进程中最关键的一件事是“自进化”。 她认为，借助强大的模型与Agent框架，在可验证的约束条件下让模型持续迭代优化，模型便能自主学习和进化，拿出更优方案。她预测，未来一到两年内，大模型叠加自进化框架，将对科学研究带来指数级加速，这并不仅仅是替代人力，而是让AI像顶尖科学家一样探索未知。\n  02\n  小米也在3月推出Xiaomi MiMo-V2-Pro、Xiaomi MiMo-V2-Omni与Xiaomi MiMo-V2-TTS三款自研大模型。\n  三款模型中，MiMo-V2-Pro是旗舰文本基座，专为高强度Agent工作场景而生，主打推理、规划与工具调用。MiMo-V2-Omni是全模态Agent基座，原生融合文本、视觉与音频感知，打通从理解到执行的完整链路。MiMo-V2-TTS是语音合成大模型，目标是为 Agent 赋予有温度、有情感的声音表达能力，构成全栈的最后一环。\n  其中，MiMo-V2-Pro作为旗舰基座模型，专为Agent场景深度优化，针对复杂多样的智能体架构进行了监督微调和强化学习，具备更强工具调用与多步推理能力，并最终交付结果。从架构上看，该模型总参数规模突破1万亿（1T），其中激活参数为42B，采用改进后的混合注意力机制（Hybrid Attention），在保证推理效率的同时大幅提升模型容量。其上下文窗口进一步扩展至100万Token，可以支持超长任务链和复杂工作流。\n  同步亮相的MiMo-V2-Omni与MiMo-V2-TTS，则补齐了感知与表达的两块拼图。前者的核心价值在于实现了音频、图像、视频的对齐。后者支持细粒度控制的情感表达引擎，让Agent具备了更接近人类的表达能力。\n  小米创始人雷军在社交平台发文表示：“在AI领域，我们今年的研发和资本投入就将超过160亿元。”他还介绍，大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上，位列全球第八。按大模型品牌来排名，排在全球第五，超过了xAlGrok。\n  本文来自微信公众号“界面新闻”，作者：沈霄戈，36氪经授权发布。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2254 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.36kr.com/p/3987267726523140","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2254 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2254,"summary_length":2254,"usable_text_length":2254,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2254,"summary_length":2254}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2254 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2254,"summary_length":2254,"usable_text_length":2254,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2254,"summary_length":2254}},"actions":{"read":"/item/84465","export_markdown":"/api/items/84465/export?format=markdown","export_json":"/api/items/84465/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.36kr.com/p/3987267726523140"}},"digest":{"id":84465,"title":"每小时“烧钱”超20万元，罗福莉直播小米大模型训练 - 36 Kr","url":"https://www.36kr.com/p/3987267726523140","source":"36 Kr","topic":"ai","published_at":"2026-09-17T10:12:21+00:00","excerpt":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。 据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 2254 characters.","reading_time_min":1,"cluster_id":3490915},"card":{"display_title":"每小时“烧钱”超20万元，罗福莉直播小米大模型训练 - 36 Kr","subtitle":"36 Kr · 2026-09-17","summary":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。 据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt ×…","badges":["quality:high"],"links":{"read":"/item/84465","original":"https://www.36kr.com/p/3987267726523140","diagnose":"/api/diagnose?url=https%3A//www.36kr.com/p/3987267726523140"},"quality_warning":null},"export":{"title":"每小时“烧钱”超20万元，罗福莉直播小米大模型训练 - 36 Kr","url":"https://www.36kr.com/p/3987267726523140","summary":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了MiMo-V2.6的实时训练页面，让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本，具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。\n  截至17日下午界面新闻发稿，两个版本累计训练成本超过135万美元，其中MiMo-V2.6-Pro时长为1天21个小时，耗费超93万美元，平均每小时耗费超2万美元；MiMo-V2.6-Flash训练时长1天16小时，耗费超42万美元，平均每小时耗费超1万美元。\n  综合计算，两个版本训练合计每小时花费约3.1万美元，折合人民币超20万元。\n  01\n  罗福莉1995年出生于四川宜宾，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间，她于2019年在人工智能领域顶级国际会议ACL上发表了8篇论文，其中2篇为第一作者。\n  她的职业生涯始于阿里巴巴达摩院，她主导开发了多语言预训练模型VECO，并推动了AliceMind的开源工作。2022年，罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作，后又担任DeepSeek的深度学习研究员，参与研发DeepSeek-V2等模型。\n  去年11月，罗福莉官宣加入小米公司。她在朋友圈发文称：“智能终将从语言迈向物理世界。我正在Xiaomi MiMo，和一群富有创造力、才华横溢且真诚热爱的研究员，致力于构建这样的未来，全力奔赴我们心目中的AGI。”据悉，Xiaomi MiMo是小米首个推理大模型。\n  一个月后，身为MiMo大模型负责人的罗福莉完成加入小米后的首秀。她在小米“人车家全生态”合作伙伴大会上，介绍了小米大模型的具体情况，并谈及自己对AI的相关看法。\n  她在活动中指出，下一代智能体系统核心围绕Agent执行与Omni（全能）感知，涵盖记忆、推理、自主规划、决策、执行多个维度，应当从回答问题走向完成任务，并且应当统一多模态感知，为理解物理世界打基础。 \n  今年3月，罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛，谈起当时火热的OpenClaw（龙虾），罗福莉将其当做一种AI框架的革命性与颠覆性事件看待，并且因为是开源，有利于整个社区参与深度改进。“另外从技术角度来说，它保证了模型下限，同时又拉升了上限，在绝大部分场景，它的任务完成度已经非常接近Claude最新模型。” \n  罗福莉还表示，在接下来一年里，AGI进程中最关键的一件事是“自进化”。 她认为，借助强大的模型与Agent框架，在可验证的约束条件下让模型持续迭代优化，模型便能自主学习和进化，拿出更优方案。她预测，未来一到两年内，大模型叠加自进化框架，将对科学研究带来指数级加速，这并不仅仅是替代人力，而是让AI像顶尖科学家一样探索未知。\n  02\n  小米也在3月推出Xiaomi MiMo-V2-Pro、Xiaomi MiMo-V2-Omni与Xiaomi MiMo-V2-TTS三款自研大模型。\n  三款模型中，MiMo-V2-Pro是旗舰文本基座，专为高强度Agent工作场景而生，主打推理、规划与工具调用。MiMo-V2-Omni是全模态Agent基座，原生融合文本、视觉与音频感知，打通从理解到执行的完整链路。MiMo-V2-TTS是语音合成大模型，目标是为 Agent 赋予有温度、有情感的声音表达能力，构成全栈的最后一环。\n  其中，MiMo-V2-Pro作为旗舰基座模型，专为Agent场景深度优化，针对复杂多样的智能体架构进行了监督微调和强化学习，具备更强工具调用与多步推理能力，并最终交付结果。从架构上看，该模型总参数规模突破1万亿（1T），其中激活参数为42B，采用改进后的混合注意力机制（Hybrid Attention），在保证推理效率的同时大幅提升模型容量。其上下文窗口进一步扩展至100万Token，可以支持超长任务链和复杂工作流。\n  同步亮相的MiMo-V2-Omni与MiMo-V2-TTS，则补齐了感知与表达的两块拼图。前者的核心价值在于实现了音频、图像、视频的对齐。后者支持细粒度控制的情感表达引擎，让Agent具备了更接近人类的表达能力。\n  小米创始人雷军在社交平台发文表示：“在AI领域，我们今年的研发和资本投入就将超过160亿元。”他还介绍，大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上，位列全球第八。按大模型品牌来排名，排在全球第五，超过了xAlGrok。\n  本文来自微信公众号“界面新闻”，作者：沈霄戈，36氪经授权发布。","source":"36 Kr","date":"2026-09-17T10:12:21+00:00","content":"“沉默近半年，我们一直在用这段时间研究一个问题：强化学习（RL）到底可以走多远。”9月17日凌晨，小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。\n  据罗福莉透露，目前小米MiMo-V2.6正处于强化学习中间阶段，其团队正在进行三方面的扩展：一是计算资源（每步约20亿个Token，1568个 Prompt × 16次Rollout，完全异步）；二是环境和测试框架（多任务智能体强化学习，一次运行中混合多个框架）；三是评估计算（代理式组内信用分配，带有测试用例和基于量规的奖励）。小米MiMo团队将在接下来的几周内逐步开源相关细节。\n  值得注意的是，罗福莉还直接晒出了MiMo-V2.6的实时训练页面，让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本，具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。\n  截至17日下午界面新闻发稿，两个版本累计训练成本超过135万美元，其中MiMo-V2.6-Pro时长为1天21个小时，耗费超93万美元，平均每小时耗费超2万美元；MiMo-V2.6-Flash训练时长1天16小时，耗费超42万美元，平均每小时耗费超1万美元。\n  综合计算，两个版本训练合计每小时花费约3.1万美元，折合人民币超20万元。\n  01\n  罗福莉1995年出生于四川宜宾，本科就读于北京师范大学计算机专业，硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间，她于2019年在人工智能领域顶级国际会议ACL上发表了8篇论文，其中2篇为第一作者。\n  她的职业生涯始于阿里巴巴达摩院，她主导开发了多语言预训练模型VECO，并推动了AliceMind的开源工作。2022年，罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作，后又担任DeepSeek的深度学习研究员，参与研发DeepSeek-V2等模型。\n  去年11月，罗福莉官宣加入小米公司。她在朋友圈发文称：“智能终将从语言迈向物理世界。我正在Xiaomi MiMo，和一群富有创造力、才华横溢且真诚热爱的研究员，致力于构建这样的未来，全力奔赴我们心目中的AGI。”据悉，Xiaomi MiMo是小米首个推理大模型。\n  一个月后，身为MiMo大模型负责人的罗福莉完成加入小米后的首秀。她在小米“人车家全生态”合作伙伴大会上，介绍了小米大模型的具体情况，并谈及自己对AI的相关看法。\n  她在活动中指出，下一代智能体系统核心围绕Agent执行与Omni（全能）感知，涵盖记忆、推理、自主规划、决策、执行多个维度，应当从回答问题走向完成任务，并且应当统一多模态感知，为理解物理世界打基础。 \n  今年3月，罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛，谈起当时火热的OpenClaw（龙虾），罗福莉将其当做一种AI框架的革命性与颠覆性事件看待，并且因为是开源，有利于整个社区参与深度改进。“另外从技术角度来说，它保证了模型下限，同时又拉升了上限，在绝大部分场景，它的任务完成度已经非常接近Claude最新模型。” \n  罗福莉还表示，在接下来一年里，AGI进程中最关键的一件事是“自进化”。 她认为，借助强大的模型与Agent框架，在可验证的约束条件下让模型持续迭代优化，模型便能自主学习和进化，拿出更优方案。她预测，未来一到两年内，大模型叠加自进化框架，将对科学研究带来指数级加速，这并不仅仅是替代人力，而是让AI像顶尖科学家一样探索未知。\n  02\n  小米也在3月推出Xiaomi MiMo-V2-Pro、Xiaomi MiMo-V2-Omni与Xiaomi MiMo-V2-TTS三款自研大模型。\n  三款模型中，MiMo-V2-Pro是旗舰文本基座，专为高强度Agent工作场景而生，主打推理、规划与工具调用。MiMo-V2-Omni是全模态Agent基座，原生融合文本、视觉与音频感知，打通从理解到执行的完整链路。MiMo-V2-TTS是语音合成大模型，目标是为 Agent 赋予有温度、有情感的声音表达能力，构成全栈的最后一环。\n  其中，MiMo-V2-Pro作为旗舰基座模型，专为Agent场景深度优化，针对复杂多样的智能体架构进行了监督微调和强化学习，具备更强工具调用与多步推理能力，并最终交付结果。从架构上看，该模型总参数规模突破1万亿（1T），其中激活参数为42B，采用改进后的混合注意力机制（Hybrid Attention），在保证推理效率的同时大幅提升模型容量。其上下文窗口进一步扩展至100万Token，可以支持超长任务链和复杂工作流。\n  同步亮相的MiMo-V2-Omni与MiMo-V2-TTS，则补齐了感知与表达的两块拼图。前者的核心价值在于实现了音频、图像、视频的对齐。后者支持细粒度控制的情感表达引擎，让Agent具备了更接近人类的表达能力。\n  小米创始人雷军在社交平台发文表示：“在AI领域，我们今年的研发和资本投入就将超过160亿元。”他还介绍，大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上，位列全球第八。按大模型品牌来排名，排在全球第五，超过了xAlGrok。\n  本文来自微信公众号“界面新闻”，作者：沈霄戈，36氪经授权发布。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.36kr.com/p/3987267726523140","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2254 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2254 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2254,"summary_length":2254,"usable_text_length":2254,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2254,"summary_length":2254}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}