# 中国让开源大模型工作更长时更“聪明” - banyuetan.org

*Источник: banyuetan.org*
*Дата: 2026-07-23*
*Язык: zh*

**Кратко:** 新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”
新华社记者张漫子
北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。
企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。
这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。
黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。
“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。
Kimi K3品牌视觉图。（月之暗面供图）
第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。
黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。
KDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。
Kimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。
针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”
据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。
黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”

新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”
新华社记者张漫子
北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。
企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。
这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。
黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。
“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。
Kimi K3品牌视觉图。（月之暗面供图）
第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。
黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。
KDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。
Kimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。
针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”
据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。
黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”

[Оригинал](http://www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html)