{"id":46332,"topic":"ai","source":"banyuetan.org","title":"中国让开源大模型工作更长时更“聪明” - banyuetan.org","url":"http://www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","url_hash":"929b90869ee9a2896d48a4182aef6e153205eb77","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMijgFBVV95cUxNcU5XYXA4U0VnNHhmbEVzeUx5dThqNWtZcVFrSFhQajFjQ18tZ1hrenFJVjNmSlhMTzFSbV9nZlJhNGJtYTRCa0dSVEgyS0hYV1c1WkJWNUFZbVBDVGR3eDRhY2N1MTVCWHczMkMxQjZON0hKUnFMNnBKSk1UVU9JbGh4ek5vbThtUi0zWHFn?oc=5\" target=\"_blank\">中国让开源大模型工作更长时更“聪明”</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">banyuetan.org</font>","content":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”\n新华社记者张漫子\n北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。\n企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。\n这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。\n黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。\n“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。\nKimi K3品牌视觉图。（月之暗面供图）\n第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。\n黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。\nKDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。\nKimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。\n针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”\n据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。\n黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”","image_url":"http://img1.banyuetan.org/group1/M00/04/75/CpAAP2ph1WeAf3-rAAC0MTvU6kc181.jpg","lang":"zh","published_at":"2026-07-23T08:36:12+00:00","fetched_at":"2026-07-26T07:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”\n新华社记者张漫子\n北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。\n企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。\n这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。\n黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。\n“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。\nKimi K3品牌视觉图。（月之暗面供图）\n第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。\n黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。\nKDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。\nKimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。\n针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”\n据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。\n黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"http://www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1130 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1130,"summary_length":1130,"usable_text_length":1130,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1130,"summary_length":1130}},"news_item":{"id":46332,"canonical_url":"http://www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","source_url":"http://www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","title":"中国让开源大模型工作更长时更“聪明” - banyuetan.org","source_name":"banyuetan.org","author":null,"published_at":"2026-07-23T08:36:12+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMijgFBVV95cUxNcU5XYXA4U0VnNHhmbEVzeUx5dThqNWtZcVFrSFhQajFjQ18tZ1hrenFJVjNmSlhMTzFSbV9nZlJhNGJtYTRCa0dSVEgyS0hYV1c1WkJWNUFZbVBDVGR3eDRhY2N1MTVCWHczMkMxQjZON0hKUnFMNnBKSk1UVU9JbGh4ek5vbThtUi0zWHFn?oc=5\" target=\"_blank\">中国让开源大模型工作更长时更“聪明”</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">banyuetan.org</font>","full_text":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”\n新华社记者张漫子\n北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。\n企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。\n这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。\n黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。\n“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。\nKimi K3品牌视觉图。（月之暗面供图）\n第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。\n黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。\nKDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。\nKimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。\n针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”\n据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。\n黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”","excerpt":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”\n新华社记者张漫子\n北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。\n企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。\n这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。\n黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。\n“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。\nKimi K3品牌视觉图。（月之暗面供图）\n第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。\n黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。\nKDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。\nKimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。\n针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”\n据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。\n黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 1130 characters.","diagnostics_url":"/api/diagnose?url=http%3A//www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1130 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1130,"summary_length":1130,"usable_text_length":1130,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1130,"summary_length":1130}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"中国让开源大模型工作更长时更“聪明” - banyuetan.org","url":"http://www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","summary":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”\n新华社记者张漫子\n北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。\n企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。\n这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。\n黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。\n“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。\nKimi K3品牌视觉图。（月之暗面供图）\n第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。\n黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。\nKDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。\nKimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。\n针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”\n据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。\n黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”","source":"banyuetan.org","date":"2026-07-23T08:36:12+00:00","content":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”\n新华社记者张漫子\n北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。\n企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。\n这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。\n黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。\n“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。\nKimi K3品牌视觉图。（月之暗面供图）\n第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。\n黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。\nKDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。\nKimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。\n针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”\n据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。\n黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”","confidence":0.9,"diagnostics_url":"/api/diagnose?url=http%3A//www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 1130 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1130 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1130,"summary_length":1130,"usable_text_length":1130,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1130,"summary_length":1130}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/46332","export_markdown":"/api/items/46332/export?format=markdown","export_json":"/api/items/46332/export?format=json","diagnose":"/api/diagnose?url=http%3A//www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html"},"formats":{"full":{"id":46332,"title":"中国让开源大模型工作更长时更“聪明” - banyuetan.org","url":"http://www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","source":"banyuetan.org","author":null,"published_at":"2026-07-23T08:36:12+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”\n新华社记者张漫子\n北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。\n企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。\n这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。\n黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。\n“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。\nKimi K3品牌视觉图。（月之暗面供图）\n第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。\n黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。\nKDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。\nKimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。\n针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”\n据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。\n黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”","full_text":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”\n新华社记者张漫子\n北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。\n企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。\n这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。\n黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。\n“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。\nKimi K3品牌视觉图。（月之暗面供图）\n第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。\n黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。\nKDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。\nKimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。\n针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”\n据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。\n黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 1130 characters.","diagnostics_url":"/api/diagnose?url=http%3A//www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1130 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1130,"summary_length":1130,"usable_text_length":1130,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1130,"summary_length":1130}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1130 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1130,"summary_length":1130,"usable_text_length":1130,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1130,"summary_length":1130}},"actions":{"read":"/item/46332","export_markdown":"/api/items/46332/export?format=markdown","export_json":"/api/items/46332/export?format=json","diagnose":"/api/diagnose?url=http%3A//www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html"}},"digest":{"id":46332,"title":"中国让开源大模型工作更长时更“聪明” - banyuetan.org","url":"http://www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","source":"banyuetan.org","topic":"ai","published_at":"2026-07-23T08:36:12+00:00","excerpt":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明” 新华社记者张漫子 北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。 企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。 这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 1130 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"中国让开源大模型工作更长时更“聪明” - banyuetan.org","subtitle":"banyuetan.org · 2026-07-23","summary":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明” 新华社记者张漫子 北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。 企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。…","badges":["quality:high"],"links":{"read":"/item/46332","original":"http://www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","diagnose":"/api/diagnose?url=http%3A//www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html"},"quality_warning":null},"export":{"title":"中国让开源大模型工作更长时更“聪明” - banyuetan.org","url":"http://www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","summary":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”\n新华社记者张漫子\n北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。\n企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。\n这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。\n黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。\n“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。\nKimi K3品牌视觉图。（月之暗面供图）\n第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。\n黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。\nKDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。\nKimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。\n针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”\n据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。\n黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”","source":"banyuetan.org","date":"2026-07-23T08:36:12+00:00","content":"新华社北京7月22日电 题：中国让开源大模型工作更长时更“聪明”\n新华社记者张漫子\n北京大模型初创公司月之暗面日前发布了全球最大规模开源模型Kimi K3，参数规模达2.8万亿，其在复杂推理、代码生成、长上下文处理及智能体任务执行等核心能力方面实现明显跃升。\n企业业务负责人黄震昕表示，K3的突破不止于“信息能够装得更多”，更在于处理信息的方式更加高效。\n这波大模型浪潮中，注意力机制成为全球主流大模型的技术基石。参数规模决定模型“能装下多少知识”，注意力机制则决定模型“会不会抓重点”，能不能从海量信息中快速找到关键、建立联系并形成答案。\n黄震昕表示，K3的第一项创新，在于团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时，计算量随文本长度增加而产生接近平方级的增长。当模型读取内容增加一倍，计算量就增至约四倍，这正是超长文本难落地的关键原因。\n“KDA通过混合线性设计，把这一开销降到接近线性增长。”黄震昕说，这意味着，在同等算力下，模型能读得更长、处理更多信息、完成更复杂任务。\nKimi K3品牌视觉图。（月之暗面供图）\n第二项创新是注意力残差技术。“模型越大、层数越多，信息传递的‘通路’就越长，信号容易衰减、失真，训练也就越容易‘翻车’。”黄震昕说，这是全球头部实验室共同面对的工程难题。\n黄震昕介绍，注意力残差技术改进了信息在不同网络层之间的传递和复用方式，相当于为大模型加装了一套“稳定器”，使2.8万亿参数不仅“训得出来”，还能稳定高效地用起来。\nKDA混合线性注意力机制解决的是“如何让大模型干活时长更长”，注意力残差技术应对的则是“超大模型怎样能越训越聪明”。两项自主研发技术共同说明，中国大模型企业的竞争力，正从扩大参数规模，延伸到基础架构和原创算法层面。\nKimi K3的发布引发国际研究机构关注。高盛集团在相关研报中，将Kimi K3视为中国模型走向定价权的新节点，并认为中国开源及开放权重模型的智能水平，正在达到面向全球扩散的关键临界点。\n针对海外部分质疑，黄震昕回应称：“K3性能跃升的核心来自底层原创架构创新，并非对现有模型蒸馏复刻。此次K3的突破恰恰印证了，开源模型与中国大模型都不应当被贴上‘低价标签’。”\n据悉，Kimi K3能够高效处理海量医学文献、药品说明书及临床指南，快速生成结构化、精准的辅助用药建议，且已实现标普与万得数据的插件接入，能够自动抓取并分析上市公司财报、债券评级、资金流向等数据，为金融行业降本增效。\n黄震昕表示，中国开源大模型不仅是效率工具，更是连接技术红利与社会福祉的桥梁，能够让技术服务更公平更高效地惠及更广泛人群。“这正是以人为本发展理念在中国科技领域的一个具体例证。”","confidence":0.9,"diagnostics_url":"/api/diagnose?url=http%3A//www.banyuetan.org/kj/detail/20260723/1000200033136211784795772281338122_1.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 1130 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1130 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1130,"summary_length":1130,"usable_text_length":1130,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1130,"summary_length":1130}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}