# 万亿参数成标配国产AI大模型打响“贴身肉搏”战|Claude Fable 5|Anthropic|DeepSeek|Kimi K3|OpenAI_手机新浪网 - 新浪财经

*Источник: 新浪财经*
*Дата: 2026-07-21*
*Язык: zh*

**Кратко:** 万亿参数成标配 国产AI大模型打响“贴身肉搏”战
证券时报记者 周春媚
两年前，当尚未出圈的DeepSeek以“价格屠夫”的姿态掀起价格战时，或许很少有人会想到，国产大模型能够在短短两年时间就将与国外顶尖模型的差距缩小至3个月以内，同时还拥有了涨价的权利。
最近，中国大模型接连取得新突破。7月17日，月之暗面发布Kimi K3模型，该模型拥有2.8万亿参数、100万词元（Token）上下文窗口，是全球参数量最大的开源权重模型。K3在独立AI模型评测机构Artificial Analysis的智能评分中排名第三，仅以微弱差距落后于Anthropic旗下的Claude Fable 5和OpenAI旗下的GPT-5.6 Sol。7月19日，阿里千问上线了Qwen3.8-Max预览版模型，并宣布Qwen3.8很快将发布并开源，该模型参数规模达2.4万亿，“可能是除了Fable 5外最强大的模型”。
万亿级别的参数规模、可与顶尖闭源模型媲美的性能，这让国产AI拥有了提价的底气。K3模型的应用程序接口（API）调用费用相比于此前的K2.6价格大幅提升，是当前最贵的一款国产大模型。在业内人士看来，这是一个重要的信号，表明国产大模型正从性价比替代者转变为技术并跑者。
然而，在这条拥挤的赛道上，玩家之间的距离不断缩短，几乎可以用“贴身肉搏”来形容。当技术领先优势可以在数周乃至数日后被迅速颠覆，大模型公司如何证明自身的独特性？这不仅决定着市场给其多高的估值，更决定着在这场“剩者为王”的淘汰赛中，谁能笑到最后。
两万亿参数俱乐部
一直以来，大模型的演进与突破，整体都遵循“大力出奇迹”的技术思想，将模型做大、数据喂多、算力堆够，其智能上限也将不断提升。虽然以DeepSeek为代表的国产大模型通过算法创新和工程优化，一定程度实现了“以小博大”，但从整体来看，大模型的参数量始终在不断提高，模型越做越大。
2024年12月，DeepSeek发布的V3模型参数量为6710亿，而今年4月发布的V4预览版已达到1.6万亿，彼时这在国内已经属于顶尖级别。然而3个月后，Kimi就发布了参数规模为2.8万亿的K3模型，阿里千问2.4万亿规模的Qwen3.8也即将发布，将国产大模型的参数门槛从万亿级直接推向了2万亿级以上。
对比国外前沿模型，Anthropic旗下的Claude Mythos 5总参数达到惊人的10万亿。“堆参数虽然有点简单粗暴，但对于提升大模型性能来说，还是有效的。”工信部信息通信经济专家委员会委员盘和林在接受证券时报记者采访时表示，大模型竞争激烈，未来很可能是“赢者通吃”的局面，只剩下少数的玩家，不投入就可能面临淘汰。
K3和Qwen3.8迈入“2万亿参数俱乐部”，被业界视为国产模型挤进AI核心竞赛圈的一大信号。和君咨询合伙人沈佳庆告诉证券时报记者，两家公司能在同一周内拿出两万亿以上参数规模的旗舰模型，说明万亿级混合专家架构的训练工程在国内已不再是探索性课题，而是进入了标准化、流水线化的成熟阶段，意味着国产头部厂商在超大规模集群训练、专家路由优化、通信瓶颈突破等底层工程上，已经形成了可复用的技术栈。
从千亿到万亿，再到2万亿，国产大模型的研发节奏正不断加快，技术的演进速度远超预期。值得注意的是，中国主流大模型普遍是开源模型。K3和Qwen3.8的各项能力接近甚至超越部分闭源模型，“这对OpenAI、Anthropic等闭源厂商构成了压力。”沈佳庆说。过去，业界普遍认为中国模型落后于国外领先模型6—9个月，但K3发布后，美国加州大学伯克利分校计算机科学教授伊恩·斯托卡认为这一差距已缩短至2—3个月。
开始拿到市场定价权
“K3的逻辑思路非常好，相较于K2.6，相当于从雇用一个刚毕业的应届生到挖来一个深耕行业5—7年的行业老手。”在试用了K3之后，一名用户说。
随着模型智能水平的提升，K3获得了更大的市场定价权。以每百万Token计算，K3的API定价为输入20元、输出100元，分别较K2.6价格高出2.1倍和2.7倍。以当前领先于K3的两款国外前沿模型为对比，Fable 5的定价为输入10美元、输出50美元，GPT-5.6 Sol的定价为输入5美元、输出30美元。虽然K3依然比国外AI公司的旗舰模型价格低，但已经比其他国产大模型要贵得多，是主动对标国外前沿模型价格区间的一次尝试。
“更大的投入必然需要更高的收费，这也说明国产大模型正在摆脱过去价格战的束缚。”盘和林表示。事实上，Kimi并非首家提价的中国大模型公司。今年以来，智谱已对GLM系列模型及API调用价格进行了3次提价，尽管价格上涨，但调用量不降反增。智谱CEO张鹏表示，今年一季度，智谱的API调用定价提升83%，但调用量依然增长了400%。K3虽然定价高昂，但推出后市场反响热烈，用户请求量大幅超出预估，Kimi不得不暂停C端新用户订阅。
一名企业AI开发人员告诉证券时报记者，如今头部大模型公司都将编程视为最核心的商业化突破口，因为其作为“生产力工具”，定价高，用户付费意愿强，盈利更有确定性。“一旦模型的性能足够强，能解决其他产品无法处理的难题，企业就愿意买单”。
但高定价并非国产大模型公司的共同选择。DeepSeek、阿里千问、字节豆包依然维持低价路线。以DeepSeek的旗舰模型V4-Pro为例，其非高峰时段每百万Token的输入与输出价格分别为3元和6元，仅仅是Claude Fable 5的零头。
相比于过去集体走性价比路线，如今国产大模型定价模式出现了明显分层。沈佳庆指出，Kimi、智谱等独立AI公司，由于没有云计算等其他业务的交叉补贴，必须追求模型业务的直接盈利，“这些走高价路线的厂商相信能力溢价，模型即产品，直接售卖稀缺能力，并通过价格信号传递跻身全球顶尖的品牌认知”。
而对于延续性价比路线的厂商来说，各自的考量也不同。千问由于背靠阿里生态且有联动发展需求，低价可以吸引开发者上云，最终通过算力租赁、存储、数据库等周边服务变现。“通过低价策略迅速扩大用户规模，产生海量的真实场景反馈数据，这些数据反过来可以用于模型迭代，形成用户越多、数据越多、模型越好的正向飞轮。”沈佳庆说，DeepSeek则通过在模型架构和训练效率上的创新，使推理成本显著低于同行，将工程效率优势转化为价格优势，获得了定价空间。
“贴身肉搏”下的突围困境
K3的发布，如蝴蝶扇动翅膀，成为了“大模型第一股”智谱股价下跌的导火索。K3并非针对智谱而来，但作为竞品，它如同一面镜子，映照出大模型行业估值逻辑的深层裂隙。
由于K3也瞄准了编程与长程智能体任务，与智谱业务高度相似，在大模型以“天”为单位持续进化的当下，大模型公司处于“贴身肉搏”的白热化竞争阶段，保持技术领先的时间窗口正不断缩短，今日的“新王”或许数周甚至数日后就会被竞争对手取代。
“大模型公司如今竞争激烈，卷价格、卷规模、卷性能，至今为止，没有谁能够确保领先，各家都在持续投入，谁能胜出不好说。”盘和林说。当万亿级参数渐成标配，技术路线和工程能力趋于同质，如果所谓的技术护城河，实际只是一道可以被快速填平的浅壕，模型的独特性与稀缺性溢价自然就会被快速稀释。
与此同时，算力正在成为制约所有玩家的共同瓶颈。一名业内人士告诉证券时报记者，要支撑万亿参数模型的推理，往往需要万卡算力集群，而且与简单的对话聊天相比，面向编程和长程智能体任务的场景，对算力的消耗更是指数级别的提升。K3在发布的短短3天后，就因用户请求量大幅超出预期而不得不暂停C端新用户订阅，这表明大模型的竞争不仅是模型智能水平的较量，还需要比拼谁的推理效率高、算力储备足、服务稳定性强。
据沈佳庆观察，中国并非没有算力，但相当一部分算力资源处于闲置或低效运行状态，头部AI公司始终面临算力紧缺的困境。“国内通信运营商、头部互联网公司和大型AI研发企业均已发力超万卡集群的建设布局，关键在于从各自为战走向统一调度。建立、发挥、完善算力调度平台的作用，将分散的智算中心纳入统一资源池，通过虚拟化技术实现跨地域、跨架构的算力共享。”沈佳庆说。

万亿参数成标配 国产AI大模型打响“贴身肉搏”战
证券时报记者 周春媚
两年前，当尚未出圈的DeepSeek以“价格屠夫”的姿态掀起价格战时，或许很少有人会想到，国产大模型能够在短短两年时间就将与国外顶尖模型的差距缩小至3个月以内，同时还拥有了涨价的权利。
最近，中国大模型接连取得新突破。7月17日，月之暗面发布Kimi K3模型，该模型拥有2.8万亿参数、100万词元（Token）上下文窗口，是全球参数量最大的开源权重模型。K3在独立AI模型评测机构Artificial Analysis的智能评分中排名第三，仅以微弱差距落后于Anthropic旗下的Claude Fable 5和OpenAI旗下的GPT-5.6 Sol。7月19日，阿里千问上线了Qwen3.8-Max预览版模型，并宣布Qwen3.8很快将发布并开源，该模型参数规模达2.4万亿，“可能是除了Fable 5外最强大的模型”。
万亿级别的参数规模、可与顶尖闭源模型媲美的性能，这让国产AI拥有了提价的底气。K3模型的应用程序接口（API）调用费用相比于此前的K2.6价格大幅提升，是当前最贵的一款国产大模型。在业内人士看来，这是一个重要的信号，表明国产大模型正从性价比替代者转变为技术并跑者。
然而，在这条拥挤的赛道上，玩家之间的距离不断缩短，几乎可以用“贴身肉搏”来形容。当技术领先优势可以在数周乃至数日后被迅速颠覆，大模型公司如何证明自身的独特性？这不仅决定着市场给其多高的估值，更决定着在这场“剩者为王”的淘汰赛中，谁能笑到最后。
两万亿参数俱乐部
一直以来，大模型的演进与突破，整体都遵循“大力出奇迹”的技术思想，将模型做大、数据喂多、算力堆够，其智能上限也将不断提升。虽然以DeepSeek为代表的国产大模型通过算法创新和工程优化，一定程度实现了“以小博大”，但从整体来看，大模型的参数量始终在不断提高，模型越做越大。
2024年12月，DeepSeek发布的V3模型参数量为6710亿，而今年4月发布的V4预览版已达到1.6万亿，彼时这在国内已经属于顶尖级别。然而3个月后，Kimi就发布了参数规模为2.8万亿的K3模型，阿里千问2.4万亿规模的Qwen3.8也即将发布，将国产大模型的参数门槛从万亿级直接推向了2万亿级以上。
对比国外前沿模型，Anthropic旗下的Claude Mythos 5总参数达到惊人的10万亿。“堆参数虽然有点简单粗暴，但对于提升大模型性能来说，还是有效的。”工信部信息通信经济专家委员会委员盘和林在接受证券时报记者采访时表示，大模型竞争激烈，未来很可能是“赢者通吃”的局面，只剩下少数的玩家，不投入就可能面临淘汰。
K3和Qwen3.8迈入“2万亿参数俱乐部”，被业界视为国产模型挤进AI核心竞赛圈的一大信号。和君咨询合伙人沈佳庆告诉证券时报记者，两家公司能在同一周内拿出两万亿以上参数规模的旗舰模型，说明万亿级混合专家架构的训练工程在国内已不再是探索性课题，而是进入了标准化、流水线化的成熟阶段，意味着国产头部厂商在超大规模集群训练、专家路由优化、通信瓶颈突破等底层工程上，已经形成了可复用的技术栈。
从千亿到万亿，再到2万亿，国产大模型的研发节奏正不断加快，技术的演进速度远超预期。值得注意的是，中国主流大模型普遍是开源模型。K3和Qwen3.8的各项能力接近甚至超越部分闭源模型，“这对OpenAI、Anthropic等闭源厂商构成了压力。”沈佳庆说。过去，业界普遍认为中国模型落后于国外领先模型6—9个月，但K3发布后，美国加州大学伯克利分校计算机科学教授伊恩·斯托卡认为这一差距已缩短至2—3个月。
开始拿到市场定价权
“K3的逻辑思路非常好，相较于K2.6，相当于从雇用一个刚毕业的应届生到挖来一个深耕行业5—7年的行业老手。”在试用了K3之后，一名用户说。
随着模型智能水平的提升，K3获得了更大的市场定价权。以每百万Token计算，K3的API定价为输入20元、输出100元，分别较K2.6价格高出2.1倍和2.7倍。以当前领先于K3的两款国外前沿模型为对比，Fable 5的定价为输入10美元、输出50美元，GPT-5.6 Sol的定价为输入5美元、输出30美元。虽然K3依然比国外AI公司的旗舰模型价格低，但已经比其他国产大模型要贵得多，是主动对标国外前沿模型价格区间的一次尝试。
“更大的投入必然需要更高的收费，这也说明国产大模型正在摆脱过去价格战的束缚。”盘和林表示。事实上，Kimi并非首家提价的中国大模型公司。今年以来，智谱已对GLM系列模型及API调用价格进行了3次提价，尽管价格上涨，但调用量不降反增。智谱CEO张鹏表示，今年一季度，智谱的API调用定价提升83%，但调用量依然增长了400%。K3虽然定价高昂，但推出后市场反响热烈，用户请求量大幅超出预估，Kimi不得不暂停C端新用户订阅。
一名企业AI开发人员告诉证券时报记者，如今头部大模型公司都将编程视为最核心的商业化突破口，因为其作为“生产力工具”，定价高，用户付费意愿强，盈利更有确定性。“一旦模型的性能足够强，能解决其他产品无法处理的难题，企业就愿意买单”。
但高定价并非国产大模型公司的共同选择。DeepSeek、阿里千问、字节豆包依然维持低价路线。以DeepSeek的旗舰模型V4-Pro为例，其非高峰时段每百万Token的输入与输出价格分别为3元和6元，仅仅是Claude Fable 5的零头。
相比于过去集体走性价比路线，如今国产大模型定价模式出现了明显分层。沈佳庆指出，Kimi、智谱等独立AI公司，由于没有云计算等其他业务的交叉补贴，必须追求模型业务的直接盈利，“这些走高价路线的厂商相信能力溢价，模型即产品，直接售卖稀缺能力，并通过价格信号传递跻身全球顶尖的品牌认知”。
而对于延续性价比路线的厂商来说，各自的考量也不同。千问由于背靠阿里生态且有联动发展需求，低价可以吸引开发者上云，最终通过算力租赁、存储、数据库等周边服务变现。“通过低价策略迅速扩大用户规模，产生海量的真实场景反馈数据，这些数据反过来可以用于模型迭代，形成用户越多、数据越多、模型越好的正向飞轮。”沈佳庆说，DeepSeek则通过在模型架构和训练效率上的创新，使推理成本显著低于同行，将工程效率优势转化为价格优势，获得了定价空间。
“贴身肉搏”下的突围困境
K3的发布，如蝴蝶扇动翅膀，成为了“大模型第一股”智谱股价下跌的导火索。K3并非针对智谱而来，但作为竞品，它如同一面镜子，映照出大模型行业估值逻辑的深层裂隙。
由于K3也瞄准了编程与长程智能体任务，与智谱业务高度相似，在大模型以“天”为单位持续进化的当下，大模型公司处于“贴身肉搏”的白热化竞争阶段，保持技术领先的时间窗口正不断缩短，今日的“新王”或许数周甚至数日后就会被竞争对手取代。
“大模型公司如今竞争激烈，卷价格、卷规模、卷性能，至今为止，没有谁能够确保领先，各家都在持续投入，谁能胜出不好说。”盘和林说。当万亿级参数渐成标配，技术路线和工程能力趋于同质，如果所谓的技术护城河，实际只是一道可以被快速填平的浅壕，模型的独特性与稀缺性溢价自然就会被快速稀释。
与此同时，算力正在成为制约所有玩家的共同瓶颈。一名业内人士告诉证券时报记者，要支撑万亿参数模型的推理，往往需要万卡算力集群，而且与简单的对话聊天相比，面向编程和长程智能体任务的场景，对算力的消耗更是指数级别的提升。K3在发布的短短3天后，就因用户请求量大幅超出预期而不得不暂停C端新用户订阅，这表明大模型的竞争不仅是模型智能水平的较量，还需要比拼谁的推理效率高、算力储备足、服务稳定性强。
据沈佳庆观察，中国并非没有算力，但相当一部分算力资源处于闲置或低效运行状态，头部AI公司始终面临算力紧缺的困境。“国内通信运营商、头部互联网公司和大型AI研发企业均已发力超万卡集群的建设布局，关键在于从各自为战走向统一调度。建立、发挥、完善算力调度平台的作用，将分散的智算中心纳入统一资源池，通过虚拟化技术实现跨地域、跨架构的算力共享。”沈佳庆说。

[Оригинал](https://finance.sina.cn/2026-07-22/detail-iniiqzkw4877916.d.html?vt=4&pos=108&his=0)