# 大模型重回参数竞赛：2万亿成标配，3万亿是下一站？ - 凤凰网

*Источник: 凤凰网*
*Дата: 2026-08-02*
*Язык: zh*

**Кратко:** 经济观察报记者 郑晨烨
7月29日，一则关于大模型公司北京月之暗面科技有限公司（下称“月之暗面”）的融资消息在业内迅速传开——月之暗面已完成新一轮超35亿美元融资，投后估值升至350亿美元，Pre-IPO轮也已启动，投前估值达到500亿美元。
这意味着，相较2025年底C轮融资时的估值43亿美元，月之暗面在半年多的时间里估值增长超过10倍，这一速度在全球AI创业公司中也不多见。记者就上述融资信息向月之暗面方面发送了求证邮件，截至发稿未获回复。
推动这轮估值跃升的核心催化剂是月之暗面7月16日发布的旗舰模型Kimi K3，该模型的参数规模达到约2.8万亿（精确值为2.78万亿），是目前全球参数量最大的开源模型。
7月19日，月之暗面发布公告，宣布暂停C端（个人用户）新用户订阅，将全部算力投入保障已有用户的服务。7月27日晚间，月之暗面进一步公开了Kimi K3的模型权重和一份47页的技术报告，对模型架构和训练方法做了全面披露。
Kimi K3的发布只是“中国大模型集体转向大参数”的一个切面：阿里7月19日发布的旗舰模型Qwen3.8 Max，参数量约2.4万亿；百度1月上线的文心5.0，参数量同样达到2.4万亿；DeepSeek 4月发布的V4-Pro，参数量为1.6万亿。另据记者了解，MiniMax（00100.HK）下一代模型的参数量也将超过2万亿。
2025年，DeepSeek R1的发布曾让行业一度转向更小参数、更低成本的路线，“Scaling Law（规模法则，即模型性能随参数规模和算力增加而可预测地提升的经验规律）是否已经失效”成为贯穿全年的热议话题。
但仅一年之后，“参数竞赛”再次启动，中国头部大模型厂商开始集体冲击2万亿以上参数。
参数跃升
Kimi K3的参数跃升幅度在行业内并不常见。
和上一代相比，Kimi K3的总参数从1.04万亿增至2.78万亿，增长了167%；激活参数从326亿增至1042亿，增长220%；上下文窗口从128K（K 代表千）扩展至100万词元（Token，AI模型处理文本的基本计量单位），扩大了近8倍。
月之暗面团队在7月27日发布的Kimi K3技术报告中指出，过去一年，开源模型在推理阶段的强化学习上进展很快，但预训练基座的参数规模停滞在1万亿左右。
大模型的训练分为两个阶段——预训练阶段，模型在海量数据上学习语言、知识和推理模式，形成底层能力，参数规模和数据质量决定了这层能力的上限；后训练阶段，研发团队通过强化学习（用奖励信号引导模型改进推理策略）、思维链（让模型把推理过程拆解成多个步骤逐步推导）等方法，在底层能力之上做精细打磨。
过去一年，行业把主要精力放在了后训练上——DeepSeek R1证明了强化学习可以在较小参数的模型上取得很好的效果，国内外厂商纷纷跟进。但Kimi K3技术报告提出的问题是，后训练的优化空间受制于预训练基座的容量，基座的能力边界决定了后训练的上限。
早在今年3月的中关村论坛上，月之暗面创始人杨植麟就公开阐述过类似的判断。他认为，做大模型本质上是把更多的能源转化成智能，规模化绝非暴力增加算力投入，而是关于转化效率的竞赛。他在演讲中拆解了三个提升效率的维度：提升词元效率，从有限的存量数据中挖掘更多智能；优化长上下文架构，以低损耗完成长时间复杂任务；引入Agent集群（多个AI智能体并行协作）模式，通过协作扩展模型执行复杂任务的边界。
华南一家大型券商的半导体分析师告诉经济观察报，参数竞赛重启还有外部推力——2026年6月下旬起，以Claude为代表的海外头部模型开始限制国内模型对其API（应用程序编程接口）的访问，这意味着蒸馏（用大模型的输出来训练小模型）作为过去两年国内模型缩短差距的重要路径，正在变得越来越窄。
在他看来，大模型的发展可以划分为三个阶段：第一阶段从2023年初到2024年第三季度，以预训练参数竞赛为主；第二阶段从2024年下半年开始，行业转向后训练的强化学习和推理优化；2026年正在进入第三阶段，模型能力从单体智能升级为系统编排，AI开始向智能体（Agent）的形态演进。
他认为，第三阶段并没有取代前两个阶段，参数量的持续增长仍然是关键变量。中国大模型的追赶将主要依赖三条路径：训练范式与海外对齐，构建自有的数据反哺循环，持续扩大预训练基座的参数规模。
深圳一家互联网游戏企业的产品经理告诉记者，对使用者来说，参数规模的直接体感是模型“能处理复杂的任务”。
据其介绍，他所在的团队从今年年初开始把AI编程工具接入日常开发流程。在一个完整的编程任务中，模型需要读取整个项目的上下文，连续调用编译、测试、调试等工具，执行多轮自我修正，单次会话消耗的词元量是传统对话场景的很多倍。这类长程任务对模型底层能力的要求，和简单的一问一答完全不在一个量级上。
由此，“模型能连续工作多久”正在成为衡量模型能力的新指标。
规模法则
2.8万亿参数规模巨大，但Ki-mi K3的每次推理并不需要动用全部参数。
根据技术报告，Kimi K3采用了MoE架构（Mixture of Ex-perts，混合专家系统）。这种架构的核心思路是把模型参数分成多个功能模块，称为“专家”。在处理每一个输入时，路由系统只激活与当前任务最相关的一小部分专家，其余专家不参与计算。
Kimi K3拥有896个专家模块，每次推理只激活其中16个，稀疏度达到56倍，实际参与计算的激活参数约1040亿。换言之，一个2.8万亿参数的模型，单次推理的算力消耗大致相当于一个千亿参数级别的稠密模型（即每次运算都调用全部参数的传统模型）。
MoE架构解决的是“参数量大但推理成本可控”的问题。在此基础上，月之暗面还需要解决两个难题：长上下文场景下的计算开销，以及信息在深层网络中的逐层衰减。
根据Kimi K3技术报告，月之暗面分别为此开发了两项底层架构。
第一项是KDA（KimiDeltaAtten－tion，混合线性注意力机制）。传统Transformer架构（当前主流大模型普遍采用的底层技术框架）在处理长上下文时，需要维护一个缓存，这个缓存的体积随输入长度线性增长。100万词元的上下文意味着庞大的显存占用和计算开销，KDA的做法是，把这个不断膨胀的缓存压缩成固定大小的矩阵状态，使百万级上下文的计算开销大幅下降。
第二项是注意力残差（AttentionResiduals）。在传统的深层网络中，信息从底层逐层向上传递，每经过一层都会有部分信息衰减或丢失。注意力残差的做法是，让每一层都能选择性地回看前序所有层的输出，跳过逐层传递的限制。根据KimiK3技术报告，这项改进的额外成本约为2%，但显著缓解了信息在深层网络中的衰减问题。
MoE、KDA和注意力残差三项技术叠加之后，KimiK3相比K2的整体扩展效率提升了约2.5倍，即同样的算力投入下KimiK3能达到更好的模型表现。
效率的提升也直接反映在了使用成本上。
根据公开的API定价，KimiK3的输入价格为每百万词元人民币20元，输出价格为100元。折合美元计算，KimiK3的输出单价约为14美元/百万词元，低于GPT-5.6Sol的30美元和ClaudeFable5的50美元。KimiK3在第三方评测中的单任务平均成本约0.94美元，与GPT-5.6Sol基本相当，约为ClaudeOpus4.8的一半。
在“用更少的算力产出更多的智能”这个方向上，端侧模型厂商走得似乎更快一些。
面壁智能CEO李大海在接受经济观察报采访时提到了一组对照数据：面壁的端侧模型用10亿到20亿的参数量，已经达到了两年前GPT-4o（Ope－nAI于2024年发布的旗舰多模态模型，参数量在数百B级别）的水平，相当于实现了近百倍的压缩。面壁联合创始人、总裁雷升涛将这个方向称为“知识密度定律”，即大约每3.5个月端侧模型的能力密度翻一倍。
云端模型在扩大参数规模，端侧模型在压缩参数规模，底层逻辑一致，都在提升每单位算力的智能产出。
在李大海看来，云端编程、长程A－gent等场景的爆发已经开始，端侧虽然还没有迎来类似的商业爆发，但模型能力的提升一直在发生。两年前，达到GPT-4o水平需要数百亿参数量级的模型，如今面壁用10亿到20亿参数量级的端侧模型就能做到。云端在做大，端侧在做小，但驱动两者进步的底层规律是同一个——投入更多的算力和更好的架构，就能换来更强的模型能力。“没有爆发不代表没有Scal－ingLaw”，他说。
野村证券7月27日发布的研报指出，3万亿参数被行业视为中国大模型的下一个里程碑，但模型竞争力将越来越依赖架构效率、后训练优化和长程任务表现。
产业链传导
参数竞赛重启的同时，头部模型厂商的商业化也在加速。
公开信息显示，月之暗面的ARR（年度经常性收入）在6月中旬突破3亿美元，API收入占比超过七成。
月之暗面企业业务负责人黄震昕在6月的一次公开活动中提到，自今年1月KimiK2.5发布以来，Kimi海外付费用户数增长了4倍，产品进入200多个国家和地区。互联网、金融、制造、教育、医疗等行业已成为Kimi重要的企业客户来源。
KimiK3发布带来的需求激增也让算力紧缺浮出水面。公开信息显示，KimiK3的部署需要一台8卡B300服务器，训练需要万卡级集群。多位接受采访的业内人士提到，智算中心的大部分算力已被头部大厂锁定，独立模型公司获取算力的能力相对滞后，即便遇到KimiK3这样的需求爆发也难以及时补充。
李大海从端侧的角度提供了观察。他用八个字概括端侧和云端的分工关系——端侧主内，云端主外。端侧掌握用户的私有数据和即时需求，数据不出设备，负责隐私敏感的本地推理；云端接入外部世界的信息和服务，处理对模型能力要求更高的开放性任务。他认为，随着云端模型参数规模持续做大，端侧和云端协同的格局会长期共存。
上述券商半导体分析师告诉记者，国内大模型竞争已经形成两个梯队：阿里和DeepSeek在模型能力和业务覆盖上位居前列，腾讯、字节、智谱、月之暗面紧随其后。竞争焦点也正在从底层模型能力转向AgentOS（智能体操作系统，即模型之上负责任务编排、工具调用和长程执行的系统层）的综合能力。
在国内竞争格局高速变动的同时，海外市场正在成为中国头部大模型厂商争夺的另一个增量来源。
野村在前述研报中提到，DeepSeek截至6月的ARR约为5.2亿美元，其中海外市场贡献了约47%到48%。不过，采用者以个人开发者和中小团队为主，大型企业的渗透率仍然有限。而且，在实际的开发流程中，不少海外开发者已经形成了分层调用的习惯，使用ClaudeCode、Codex等海外模型做架构设计和复杂推理，再切换到DeepSeek等国产模型做持续的代码生成和执行。也就是说，国产模型率先拿下的，是词元消耗最密集的执行环节。
华东一家大型公募机构的研究员告诉记者，词元的整体成本在持续下降，预计年降幅在三成到五成。值得注意的是，Agent链路中等复杂度的任务，单次调用消耗的词元量是传统对话场景的二十多倍，超复杂任务的单次消耗达到百万词元级别。成本下降正在激发更多复杂任务的需求，整体利润由增量市场驱动。“做大参数”对算力产业链的影响也已经开始传导到芯片层面。
聆思科技是一家由科大讯飞体系孵化的端侧AI推理芯片公司，已累计出货超过1.5亿颗芯片，7月刚完成近5亿元B轮融资，首颗端侧大模型推理芯片Nebula系列计划于年底流片。
聆思科技市场副总裁韩超阳告诉经济观察报，端侧推理市场的规模未来将比云端大出不止一个数量级。他同时强调，算力利用率比绝对算力峰值更关键，一颗标称200T（每秒200万亿次运算）算力但利用率只有百分之十几的芯片，和一颗100T算力利用率达到七成的芯片，实际产出完全不同。
但当前端侧芯片在推理性能和功耗上仍无法满足需求，在他看来整个市场仍处于萌芽阶段。
聆思科技副总裁徐燕松提到，芯片公司和算法公司未来可能不再独立存在，芯片设计必须比算法迭代更前置地投入研发，“芯片的研发周期通常在两到三年，必须提前判断两三年后模型架构的走向，否则芯片推出时就已经落伍了”。
这也意味着，参数竞赛重启的影响不会停留在模型层面，它正在沿着产业链上游的芯片设计和算力基础设施传导。
在上述公募机构研究员看来，大模型向行业场景的渗透可以分为三个阶段：第一阶段是AI编程代理，对应全球约3000万软件开发者和部分外包采购市场，核心规模约7000亿美元；第二阶段是流程性AI代理，面向客服、财务、行政等约3.7亿白领办公人群，薪酬池规模超过1万亿美元；第三阶段及之后将延伸至金融、医疗、法律等专业领域，市场体量达到3万亿至4万亿美元以上。
他认为，目前仅处于第一个阶段的初期。按照上述框架来看，当前围绕AI编程场景的词元消耗量爆发，距离真正的规模化渗透还很远。
“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

经济观察报记者 郑晨烨
7月29日，一则关于大模型公司北京月之暗面科技有限公司（下称“月之暗面”）的融资消息在业内迅速传开——月之暗面已完成新一轮超35亿美元融资，投后估值升至350亿美元，Pre-IPO轮也已启动，投前估值达到500亿美元。
这意味着，相较2025年底C轮融资时的估值43亿美元，月之暗面在半年多的时间里估值增长超过10倍，这一速度在全球AI创业公司中也不多见。记者就上述融资信息向月之暗面方面发送了求证邮件，截至发稿未获回复。
推动这轮估值跃升的核心催化剂是月之暗面7月16日发布的旗舰模型Kimi K3，该模型的参数规模达到约2.8万亿（精确值为2.78万亿），是目前全球参数量最大的开源模型。
7月19日，月之暗面发布公告，宣布暂停C端（个人用户）新用户订阅，将全部算力投入保障已有用户的服务。7月27日晚间，月之暗面进一步公开了Kimi K3的模型权重和一份47页的技术报告，对模型架构和训练方法做了全面披露。
Kimi K3的发布只是“中国大模型集体转向大参数”的一个切面：阿里7月19日发布的旗舰模型Qwen3.8 Max，参数量约2.4万亿；百度1月上线的文心5.0，参数量同样达到2.4万亿；DeepSeek 4月发布的V4-Pro，参数量为1.6万亿。另据记者了解，MiniMax（00100.HK）下一代模型的参数量也将超过2万亿。
2025年，DeepSeek R1的发布曾让行业一度转向更小参数、更低成本的路线，“Scaling Law（规模法则，即模型性能随参数规模和算力增加而可预测地提升的经验规律）是否已经失效”成为贯穿全年的热议话题。
但仅一年之后，“参数竞赛”再次启动，中国头部大模型厂商开始集体冲击2万亿以上参数。
参数跃升
Kimi K3的参数跃升幅度在行业内并不常见。
和上一代相比，Kimi K3的总参数从1.04万亿增至2.78万亿，增长了167%；激活参数从326亿增至1042亿，增长220%；上下文窗口从128K（K 代表千）扩展至100万词元（Token，AI模型处理文本的基本计量单位），扩大了近8倍。
月之暗面团队在7月27日发布的Kimi K3技术报告中指出，过去一年，开源模型在推理阶段的强化学习上进展很快，但预训练基座的参数规模停滞在1万亿左右。
大模型的训练分为两个阶段——预训练阶段，模型在海量数据上学习语言、知识和推理模式，形成底层能力，参数规模和数据质量决定了这层能力的上限；后训练阶段，研发团队通过强化学习（用奖励信号引导模型改进推理策略）、思维链（让模型把推理过程拆解成多个步骤逐步推导）等方法，在底层能力之上做精细打磨。
过去一年，行业把主要精力放在了后训练上——DeepSeek R1证明了强化学习可以在较小参数的模型上取得很好的效果，国内外厂商纷纷跟进。但Kimi K3技术报告提出的问题是，后训练的优化空间受制于预训练基座的容量，基座的能力边界决定了后训练的上限。
早在今年3月的中关村论坛上，月之暗面创始人杨植麟就公开阐述过类似的判断。他认为，做大模型本质上是把更多的能源转化成智能，规模化绝非暴力增加算力投入，而是关于转化效率的竞赛。他在演讲中拆解了三个提升效率的维度：提升词元效率，从有限的存量数据中挖掘更多智能；优化长上下文架构，以低损耗完成长时间复杂任务；引入Agent集群（多个AI智能体并行协作）模式，通过协作扩展模型执行复杂任务的边界。
华南一家大型券商的半导体分析师告诉经济观察报，参数竞赛重启还有外部推力——2026年6月下旬起，以Claude为代表的海外头部模型开始限制国内模型对其API（应用程序编程接口）的访问，这意味着蒸馏（用大模型的输出来训练小模型）作为过去两年国内模型缩短差距的重要路径，正在变得越来越窄。
在他看来，大模型的发展可以划分为三个阶段：第一阶段从2023年初到2024年第三季度，以预训练参数竞赛为主；第二阶段从2024年下半年开始，行业转向后训练的强化学习和推理优化；2026年正在进入第三阶段，模型能力从单体智能升级为系统编排，AI开始向智能体（Agent）的形态演进。
他认为，第三阶段并没有取代前两个阶段，参数量的持续增长仍然是关键变量。中国大模型的追赶将主要依赖三条路径：训练范式与海外对齐，构建自有的数据反哺循环，持续扩大预训练基座的参数规模。
深圳一家互联网游戏企业的产品经理告诉记者，对使用者来说，参数规模的直接体感是模型“能处理复杂的任务”。
据其介绍，他所在的团队从今年年初开始把AI编程工具接入日常开发流程。在一个完整的编程任务中，模型需要读取整个项目的上下文，连续调用编译、测试、调试等工具，执行多轮自我修正，单次会话消耗的词元量是传统对话场景的很多倍。这类长程任务对模型底层能力的要求，和简单的一问一答完全不在一个量级上。
由此，“模型能连续工作多久”正在成为衡量模型能力的新指标。
规模法则
2.8万亿参数规模巨大，但Ki-mi K3的每次推理并不需要动用全部参数。
根据技术报告，Kimi K3采用了MoE架构（Mixture of Ex-perts，混合专家系统）。这种架构的核心思路是把模型参数分成多个功能模块，称为“专家”。在处理每一个输入时，路由系统只激活与当前任务最相关的一小部分专家，其余专家不参与计算。
Kimi K3拥有896个专家模块，每次推理只激活其中16个，稀疏度达到56倍，实际参与计算的激活参数约1040亿。换言之，一个2.8万亿参数的模型，单次推理的算力消耗大致相当于一个千亿参数级别的稠密模型（即每次运算都调用全部参数的传统模型）。
MoE架构解决的是“参数量大但推理成本可控”的问题。在此基础上，月之暗面还需要解决两个难题：长上下文场景下的计算开销，以及信息在深层网络中的逐层衰减。
根据Kimi K3技术报告，月之暗面分别为此开发了两项底层架构。
第一项是KDA（KimiDeltaAtten－tion，混合线性注意力机制）。传统Transformer架构（当前主流大模型普遍采用的底层技术框架）在处理长上下文时，需要维护一个缓存，这个缓存的体积随输入长度线性增长。100万词元的上下文意味着庞大的显存占用和计算开销，KDA的做法是，把这个不断膨胀的缓存压缩成固定大小的矩阵状态，使百万级上下文的计算开销大幅下降。
第二项是注意力残差（AttentionResiduals）。在传统的深层网络中，信息从底层逐层向上传递，每经过一层都会有部分信息衰减或丢失。注意力残差的做法是，让每一层都能选择性地回看前序所有层的输出，跳过逐层传递的限制。根据KimiK3技术报告，这项改进的额外成本约为2%，但显著缓解了信息在深层网络中的衰减问题。
MoE、KDA和注意力残差三项技术叠加之后，KimiK3相比K2的整体扩展效率提升了约2.5倍，即同样的算力投入下KimiK3能达到更好的模型表现。
效率的提升也直接反映在了使用成本上。
根据公开的API定价，KimiK3的输入价格为每百万词元人民币20元，输出价格为100元。折合美元计算，KimiK3的输出单价约为14美元/百万词元，低于GPT-5.6Sol的30美元和ClaudeFable5的50美元。KimiK3在第三方评测中的单任务平均成本约0.94美元，与GPT-5.6Sol基本相当，约为ClaudeOpus4.8的一半。
在“用更少的算力产出更多的智能”这个方向上，端侧模型厂商走得似乎更快一些。
面壁智能CEO李大海在接受经济观察报采访时提到了一组对照数据：面壁的端侧模型用10亿到20亿的参数量，已经达到了两年前GPT-4o（Ope－nAI于2024年发布的旗舰多模态模型，参数量在数百B级别）的水平，相当于实现了近百倍的压缩。面壁联合创始人、总裁雷升涛将这个方向称为“知识密度定律”，即大约每3.5个月端侧模型的能力密度翻一倍。
云端模型在扩大参数规模，端侧模型在压缩参数规模，底层逻辑一致，都在提升每单位算力的智能产出。
在李大海看来，云端编程、长程A－gent等场景的爆发已经开始，端侧虽然还没有迎来类似的商业爆发，但模型能力的提升一直在发生。两年前，达到GPT-4o水平需要数百亿参数量级的模型，如今面壁用10亿到20亿参数量级的端侧模型就能做到。云端在做大，端侧在做小，但驱动两者进步的底层规律是同一个——投入更多的算力和更好的架构，就能换来更强的模型能力。“没有爆发不代表没有Scal－ingLaw”，他说。
野村证券7月27日发布的研报指出，3万亿参数被行业视为中国大模型的下一个里程碑，但模型竞争力将越来越依赖架构效率、后训练优化和长程任务表现。
产业链传导
参数竞赛重启的同时，头部模型厂商的商业化也在加速。
公开信息显示，月之暗面的ARR（年度经常性收入）在6月中旬突破3亿美元，API收入占比超过七成。
月之暗面企业业务负责人黄震昕在6月的一次公开活动中提到，自今年1月KimiK2.5发布以来，Kimi海外付费用户数增长了4倍，产品进入200多个国家和地区。互联网、金融、制造、教育、医疗等行业已成为Kimi重要的企业客户来源。
KimiK3发布带来的需求激增也让算力紧缺浮出水面。公开信息显示，KimiK3的部署需要一台8卡B300服务器，训练需要万卡级集群。多位接受采访的业内人士提到，智算中心的大部分算力已被头部大厂锁定，独立模型公司获取算力的能力相对滞后，即便遇到KimiK3这样的需求爆发也难以及时补充。
李大海从端侧的角度提供了观察。他用八个字概括端侧和云端的分工关系——端侧主内，云端主外。端侧掌握用户的私有数据和即时需求，数据不出设备，负责隐私敏感的本地推理；云端接入外部世界的信息和服务，处理对模型能力要求更高的开放性任务。他认为，随着云端模型参数规模持续做大，端侧和云端协同的格局会长期共存。
上述券商半导体分析师告诉记者，国内大模型竞争已经形成两个梯队：阿里和DeepSeek在模型能力和业务覆盖上位居前列，腾讯、字节、智谱、月之暗面紧随其后。竞争焦点也正在从底层模型能力转向AgentOS（智能体操作系统，即模型之上负责任务编排、工具调用和长程执行的系统层）的综合能力。
在国内竞争格局高速变动的同时，海外市场正在成为中国头部大模型厂商争夺的另一个增量来源。
野村在前述研报中提到，DeepSeek截至6月的ARR约为5.2亿美元，其中海外市场贡献了约47%到48%。不过，采用者以个人开发者和中小团队为主，大型企业的渗透率仍然有限。而且，在实际的开发流程中，不少海外开发者已经形成了分层调用的习惯，使用ClaudeCode、Codex等海外模型做架构设计和复杂推理，再切换到DeepSeek等国产模型做持续的代码生成和执行。也就是说，国产模型率先拿下的，是词元消耗最密集的执行环节。
华东一家大型公募机构的研究员告诉记者，词元的整体成本在持续下降，预计年降幅在三成到五成。值得注意的是，Agent链路中等复杂度的任务，单次调用消耗的词元量是传统对话场景的二十多倍，超复杂任务的单次消耗达到百万词元级别。成本下降正在激发更多复杂任务的需求，整体利润由增量市场驱动。“做大参数”对算力产业链的影响也已经开始传导到芯片层面。
聆思科技是一家由科大讯飞体系孵化的端侧AI推理芯片公司，已累计出货超过1.5亿颗芯片，7月刚完成近5亿元B轮融资，首颗端侧大模型推理芯片Nebula系列计划于年底流片。
聆思科技市场副总裁韩超阳告诉经济观察报，端侧推理市场的规模未来将比云端大出不止一个数量级。他同时强调，算力利用率比绝对算力峰值更关键，一颗标称200T（每秒200万亿次运算）算力但利用率只有百分之十几的芯片，和一颗100T算力利用率达到七成的芯片，实际产出完全不同。
但当前端侧芯片在推理性能和功耗上仍无法满足需求，在他看来整个市场仍处于萌芽阶段。
聆思科技副总裁徐燕松提到，芯片公司和算法公司未来可能不再独立存在，芯片设计必须比算法迭代更前置地投入研发，“芯片的研发周期通常在两到三年，必须提前判断两三年后模型架构的走向，否则芯片推出时就已经落伍了”。
这也意味着，参数竞赛重启的影响不会停留在模型层面，它正在沿着产业链上游的芯片设计和算力基础设施传导。
在上述公募机构研究员看来，大模型向行业场景的渗透可以分为三个阶段：第一阶段是AI编程代理，对应全球约3000万软件开发者和部分外包采购市场，核心规模约7000亿美元；第二阶段是流程性AI代理，面向客服、财务、行政等约3.7亿白领办公人群，薪酬池规模超过1万亿美元；第三阶段及之后将延伸至金融、医疗、法律等专业领域，市场体量达到3万亿至4万亿美元以上。
他认为，目前仅处于第一个阶段的初期。按照上述框架来看，当前围绕AI编程场景的词元消耗量爆发，距离真正的规模化渗透还很远。
“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

[Оригинал](https://finance.ifeng.com/c/8vGZLG0haPK)