{"id":88543,"topic":"ai","source":"t.cj.sina.cn","title":"小米大模型6天“烧掉”347万美元 - t.cj.sina.cn","url":"https://t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","url_hash":"c35ded08cc6df5f39f5aaab88453eebbe2b03d03","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMickFVX3lxTE12RTYteFd3N2MyU2doakVKWXZLU29RaXJZTWxVdXFEM2F1Nm1qcUtvSUpTVzJxZS1jMXQ4LUNWQVN3THJJNkg0Vm1FdjlSc2lNUWJJb1N6UUhueWJteWU5cEF6SEhEUmZPQTI5blc4VnJqdw?oc=5\" target=\"_blank\">小米大模型6天“烧掉”347万美元</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">t.cj.sina.cn</font>","content":"21世纪经济报道记者雷晨\n9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。\n小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。\n据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。\n烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。\n技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。\n能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。\n开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。\n客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。","image_url":null,"lang":"zh","published_at":"2026-09-23T02:57:00+00:00","fetched_at":"2026-09-23T05:15:09+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"21世纪经济报道记者雷晨\n9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。\n小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。\n据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。\n烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。\n技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。\n能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。\n开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。\n客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1309 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1309,"summary_length":1309,"usable_text_length":1309,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1309,"summary_length":1309}},"news_item":{"id":88543,"canonical_url":"https://t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","source_url":"https://t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","title":"小米大模型6天“烧掉”347万美元 - t.cj.sina.cn","source_name":"t.cj.sina.cn","author":null,"published_at":"2026-09-23T02:57:00+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMickFVX3lxTE12RTYteFd3N2MyU2doakVKWXZLU29RaXJZTWxVdXFEM2F1Nm1qcUtvSUpTVzJxZS1jMXQ4LUNWQVN3THJJNkg0Vm1FdjlSc2lNUWJJb1N6UUhueWJteWU5cEF6SEhEUmZPQTI5blc4VnJqdw?oc=5\" target=\"_blank\">小米大模型6天“烧掉”347万美元</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">t.cj.sina.cn</font>","full_text":"21世纪经济报道记者雷晨\n9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。\n小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。\n据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。\n烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。\n技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。\n能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。\n开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。\n客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。","excerpt":"21世纪经济报道记者雷晨\n9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。\n小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。\n据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。\n烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。\n技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。\n能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。\n开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。\n客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 1309 characters.","diagnostics_url":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1309 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1309,"summary_length":1309,"usable_text_length":1309,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1309,"summary_length":1309}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"小米大模型6天“烧掉”347万美元 - t.cj.sina.cn","url":"https://t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","summary":"21世纪经济报道记者雷晨\n9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。\n小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。\n据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。\n烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。\n技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。\n能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。\n开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。\n客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。","source":"t.cj.sina.cn","date":"2026-09-23T02:57:00+00:00","content":"21世纪经济报道记者雷晨\n9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。\n小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。\n据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。\n烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。\n技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。\n能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。\n开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。\n客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 1309 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1309 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1309,"summary_length":1309,"usable_text_length":1309,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1309,"summary_length":1309}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/88543","export_markdown":"/api/items/88543/export?format=markdown","export_json":"/api/items/88543/export?format=json","diagnose":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k"},"formats":{"full":{"id":88543,"title":"小米大模型6天“烧掉”347万美元 - t.cj.sina.cn","url":"https://t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","source":"t.cj.sina.cn","author":null,"published_at":"2026-09-23T02:57:00+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"21世纪经济报道记者雷晨\n9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。\n小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。\n据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。\n烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。\n技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。\n能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。\n开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。\n客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。","full_text":"21世纪经济报道记者雷晨\n9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。\n小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。\n据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。\n烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。\n技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。\n能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。\n开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。\n客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 1309 characters.","diagnostics_url":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1309 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1309,"summary_length":1309,"usable_text_length":1309,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1309,"summary_length":1309}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1309 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1309,"summary_length":1309,"usable_text_length":1309,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1309,"summary_length":1309}},"actions":{"read":"/item/88543","export_markdown":"/api/items/88543/export?format=markdown","export_json":"/api/items/88543/export?format=json","diagnose":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k"}},"digest":{"id":88543,"title":"小米大模型6天“烧掉”347万美元 - t.cj.sina.cn","url":"https://t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","source":"t.cj.sina.cn","topic":"ai","published_at":"2026-09-23T02:57:00+00:00","excerpt":"21世纪经济报道记者雷晨 9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。 小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。 据Artificial…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 1309 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"小米大模型6天“烧掉”347万美元 - t.cj.sina.cn","subtitle":"t.cj.sina.cn · 2026-09-23","summary":"21世纪经济报道记者雷晨 9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。…","badges":["quality:high"],"links":{"read":"/item/88543","original":"https://t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","diagnose":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k"},"quality_warning":null},"export":{"title":"小米大模型6天“烧掉”347万美元 - t.cj.sina.cn","url":"https://t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","summary":"21世纪经济报道记者雷晨\n9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。\n小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。\n据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。\n烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。\n技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。\n能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。\n开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。\n客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。","source":"t.cj.sina.cn","date":"2026-09-23T02:57:00+00:00","content":"21世纪经济报道记者雷晨\n9月22日，小米正式发布并开源MiMo-V2.6系列，包含全模态旗舰Pro与高效推理Flash，Pro超高速模式V2.6-Pro-Ultraspeed同步上线，MiMoDesktop桌面客户端正式版推出。\n小米集团创始人雷军当日发布微博称，9月17日起公开直播MiMo-V2.6强化学习后训练过程，六天直播背后是近半年基础研究和工程试错；此次保持模型架构和参数规模不变，通过扩大RL训练规模，提升编程、智能体、设计、研究等任务能力，API定价不变。\n据Artificial Analysis发布的综合智能指数，MiMo-V2.6-Pro获46分，列全球开源模型第一、国产模型第一，超过Kimi K3、Qwen3.8 Max，并首次支持文本、图片、视频、音频全模态，是全球开源阵容中唯一全模态Pro模型。单任务成本榜单显示，其实测单任务成本为0.13美元，首次进入0.1美元区间，API定价沿用V2.5，同等智能水平下价格仅为海外模型的1/20至1/60。\n烧钱规模同样直观：RL后训练约6天，Flash成本约85万美元，Pro约262万美元，合计超347万美元，累计约75万条轨迹。长程软件工程评测中，Flash得分从48.8升至65.68，Pro得分从58.4升至72.57。\n技术侧，小米采用大Batch与全异步架构，单次更新1568个样本，支持1M上下文训练，单步Token达3.5-3.7B；混合多Harness框架，为Long Horizon RL提供更精准奖励信号；冻结Router抑制漂移，并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的Reward Hacking防线。\n能力跃升体现在科研场景。Pro以“Co-Scientist”角色协助材料团队设计MOF方案，吸附PFAS，将约一个月的研发周期缩短至2—3天，效率提升约10倍。它还在Lean 4中完成论文《周期三蕴含混沌》中的Li-Yorke定理主定理形式化，形成6000余行源码，全部通过内核核验，且此前未接受Lean专项后训练。Design Arena评测中，其设计能力接近Claude Opus 5与GPT-5.6 Sol。\n开源力度是另一重点。小米除开放Pro和Flash权重外，还开源RL技术成果、MiMo-V2.6-Distill-Qwen-9B、7000余个高质量任务环境、端到端RL训练框架与轻量化Agent框架。以Distill-Qwen-9B为起点进行RL训练，11项评测全面提升：SWE-bench Verified得分从61.1升至66.2，MiMo Cyber Bench从31.3升至47.0，Terminal Bench 2.1从37.1升至52.8，MiMo Visual Coding从64.0升至72.4。\n客观来看，这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347万美元只覆盖RL后训练，不含前期研发与推理成本；0.13美元的单任务成本能否支撑商业闭环，开源能否转化为生态主导权，仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/1651428902/v626ece2602001k48k","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 1309 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1309 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1309,"summary_length":1309,"usable_text_length":1309,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1309,"summary_length":1309}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}