{"id":85491,"topic":"ai","source":"新浪财经","title":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片） - 新浪财经","url":"https://finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html?vt=4","url_hash":"1ffa14d2dbed6fe309ed1e38ff22e09ce8b62ef0","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMieEFVX3lxTE16cWpKVW9Kd1ZnSTdxa1ZMTTA1eFBHdHlUeFZBMzNMMlUtbGFtQzl4TldJSURxbGQzZnM5WGlJZVdCZVhMZEJzVTREV2s5WG94Q3FobmRlTU9ONHFkd0Myb1lLcGZTRTlHWHY4azYxZWhpLWk2UmNfVw?oc=5\" target=\"_blank\">移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪财经</font>","content":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）\n2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。\n大模型推理进入爆发期\n传统架构遭遇双重瓶颈\n随着人工智能产业重心从模型训练转向规模化推理服务，推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求，传统单一GPU推理架构越来越吃力。一方面，数据频繁搬运会带来“内存墙”和“功耗墙”；另一方面，国内先进芯片制程供给受限，单纯靠硬件工艺升级提升算力，空间有限。行业需要跳出“只追先进制程”的思路，从系统架构层面寻找新解法。\n国产GPU与类脑芯片分工\n混合推理技术实现突破\n项目团队从系统架构创新入手，首次将国产通用GPU与类脑芯片深度融合，打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型AF分离推理模式：将Attention（注意力）计算与FFN（前馈网络）模块拆分，由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载，FFN模块交由类脑芯片处理，充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势，突破传统GPU推理瓶颈。\n同时，团队自研的模型编译器、高速互联协议和统一推理引擎，可完成两类算力的任务拆解、协同调度、结果聚合，真正实现了两种架构算力优势互补。项目已在DeepSeek-V4-Flash大模型上完成完整调优验证，相较同类国产GPU算力集群，推理输出和能效均提升1倍以上，业务运营成本降低超40％。\n这意味着，移动云依托国内成熟工艺的国产芯片，通过系统架构创新，具备对标国际下一代推理架构的业务能力，为大模型推理国产化落地提供了可复制的技术范式。\n产学研协同共建\n面向多场景推进落地开放\n该成果是产学研用协同创新的典型实践，整合运营商、芯片企业、科研院所、高校多方力量，打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续移动云将持续迭代异构推理系统，面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证，并计划将核心异构推理框架逐步开放，赋能国内GPU、类脑芯片厂商及算力运营商，带动国产算力产业链整体发展。\n本次异构混合推理系统在中国算力大会首发，为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束，这一方案也为国内AI算力自主发展提供重要的创新参考方向。","image_url":"https://n.sinaimg.cn/spider20260918/400/w1200h800/20260918/e966-d6a6e3e260dd84975a6d97127b08252e.jpg","lang":"zh","published_at":"2026-09-18T20:48:45+00:00","fetched_at":"2026-09-18T21:15:09+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）\n2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。\n大模型推理进入爆发期\n传统架构遭遇双重瓶颈\n随着人工智能产业重心从模型训练转向规模化推理服务，推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求，传统单一GPU推理架构越来越吃力。一方面，数据频繁搬运会带来“内存墙”和“功耗墙”；另一方面，国内先进芯片制程供给受限，单纯靠硬件工艺升级提升算力，空间有限。行业需要跳出“只追先进制程”的思路，从系统架构层面寻找新解法。\n国产GPU与类脑芯片分工\n混合推理技术实现突破\n项目团队从系统架构创新入手，首次将国产通用GPU与类脑芯片深度融合，打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型AF分离推理模式：将Attention（注意力）计算与FFN（前馈网络）模块拆分，由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载，FFN模块交由类脑芯片处理，充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势，突破传统GPU推理瓶颈。\n同时，团队自研的模型编译器、高速互联协议和统一推理引擎，可完成两类算力的任务拆解、协同调度、结果聚合，真正实现了两种架构算力优势互补。项目已在DeepSeek-V4-Flash大模型上完成完整调优验证，相较同类国产GPU算力集群，推理输出和能效均提升1倍以上，业务运营成本降低超40％。\n这意味着，移动云依托国内成熟工艺的国产芯片，通过系统架构创新，具备对标国际下一代推理架构的业务能力，为大模型推理国产化落地提供了可复制的技术范式。\n产学研协同共建\n面向多场景推进落地开放\n该成果是产学研用协同创新的典型实践，整合运营商、芯片企业、科研院所、高校多方力量，打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续移动云将持续迭代异构推理系统，面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证，并计划将核心异构推理框架逐步开放，赋能国内GPU、类脑芯片厂商及算力运营商，带动国产算力产业链整体发展。\n本次异构混合推理系统在中国算力大会首发，为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束，这一方案也为国内AI算力自主发展提供重要的创新参考方向。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html?vt=4","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1171 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1171,"summary_length":1171,"usable_text_length":1171,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1171,"summary_length":1171}},"news_item":{"id":85491,"canonical_url":"https://finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html?vt=4","source_url":"https://finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html?vt=4","title":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片） - 新浪财经","source_name":"新浪财经","author":null,"published_at":"2026-09-18T20:48:45+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMieEFVX3lxTE16cWpKVW9Kd1ZnSTdxa1ZMTTA1eFBHdHlUeFZBMzNMMlUtbGFtQzl4TldJSURxbGQzZnM5WGlJZVdCZVhMZEJzVTREV2s5WG94Q3FobmRlTU9ONHFkd0Myb1lLcGZTRTlHWHY4azYxZWhpLWk2UmNfVw?oc=5\" target=\"_blank\">移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪财经</font>","full_text":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）\n2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。\n大模型推理进入爆发期\n传统架构遭遇双重瓶颈\n随着人工智能产业重心从模型训练转向规模化推理服务，推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求，传统单一GPU推理架构越来越吃力。一方面，数据频繁搬运会带来“内存墙”和“功耗墙”；另一方面，国内先进芯片制程供给受限，单纯靠硬件工艺升级提升算力，空间有限。行业需要跳出“只追先进制程”的思路，从系统架构层面寻找新解法。\n国产GPU与类脑芯片分工\n混合推理技术实现突破\n项目团队从系统架构创新入手，首次将国产通用GPU与类脑芯片深度融合，打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型AF分离推理模式：将Attention（注意力）计算与FFN（前馈网络）模块拆分，由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载，FFN模块交由类脑芯片处理，充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势，突破传统GPU推理瓶颈。\n同时，团队自研的模型编译器、高速互联协议和统一推理引擎，可完成两类算力的任务拆解、协同调度、结果聚合，真正实现了两种架构算力优势互补。项目已在DeepSeek-V4-Flash大模型上完成完整调优验证，相较同类国产GPU算力集群，推理输出和能效均提升1倍以上，业务运营成本降低超40％。\n这意味着，移动云依托国内成熟工艺的国产芯片，通过系统架构创新，具备对标国际下一代推理架构的业务能力，为大模型推理国产化落地提供了可复制的技术范式。\n产学研协同共建\n面向多场景推进落地开放\n该成果是产学研用协同创新的典型实践，整合运营商、芯片企业、科研院所、高校多方力量，打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续移动云将持续迭代异构推理系统，面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证，并计划将核心异构推理框架逐步开放，赋能国内GPU、类脑芯片厂商及算力运营商，带动国产算力产业链整体发展。\n本次异构混合推理系统在中国算力大会首发，为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束，这一方案也为国内AI算力自主发展提供重要的创新参考方向。","excerpt":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）\n2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。\n大模型推理进入爆发期\n传统架构遭遇双重瓶颈\n随着人工智能产业重心从模型训练转向规模化推理服务，推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求，传统单一GPU推理架构越来越吃力。一方面，数据频繁搬运会带来“内存墙”和“功耗墙”；另一方面，国内先进芯片制程供给受限，单纯靠硬件工艺升级提升算力，空间有限。行业需要跳出“只追先进制程”的思路，从系统架构层面寻找新解法。\n国产GPU与类脑芯片分工\n混合推理技术实现突破\n项目团队从系统架构创新入手，首次将国产通用GPU与类脑芯片深度融合，打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型AF分离推理模式：将Attention（注意力）计算与FFN（前馈网络）模块拆分，由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载，FFN模块交由类脑芯片处理，充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势，突破传统GPU推理瓶颈。\n同时，团队自研的模型编译器、高速互联协议和统一推理引擎，可完成两类算力的任务拆解、协同调度、结果聚合，真正实现了两种架构算力优势互补。项目已在DeepSeek-V4-Flash大模型上完成完整调优验证，相较同类国产GPU算力集群，推理输出和能效均提升1倍以上，业务运营成本降低超40％。\n这意味着，移动云依托国内成熟工艺的国产芯片，通过系统架构创新，具备对标国际下一代推理架构的业务能力，为大模型推理国产化落地提供了可复制的技术范式。\n产学研协同共建\n面向多场景推进落地开放\n该成果是产学研用协同创新的典型实践，整合运营商、芯片企业、科研院所、高校多方力量，打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续移动云将持续迭代异构推理系统，面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证，并计划将核心异构推理框架逐步开放，赋能国内GPU、类脑芯片厂商及算力运营商，带动国产算力产业链整体发展。\n本次异构混合推理系统在中国算力大会首发，为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束，这一方案也为国内AI算力自主发展提供重要的创新参考方向。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 1171 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html%3Fvt%3D4","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1171 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1171,"summary_length":1171,"usable_text_length":1171,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1171,"summary_length":1171}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片） - 新浪财经","url":"https://finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html?vt=4","summary":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）\n2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。\n大模型推理进入爆发期\n传统架构遭遇双重瓶颈\n随着人工智能产业重心从模型训练转向规模化推理服务，推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求，传统单一GPU推理架构越来越吃力。一方面，数据频繁搬运会带来“内存墙”和“功耗墙”；另一方面，国内先进芯片制程供给受限，单纯靠硬件工艺升级提升算力，空间有限。行业需要跳出“只追先进制程”的思路，从系统架构层面寻找新解法。\n国产GPU与类脑芯片分工\n混合推理技术实现突破\n项目团队从系统架构创新入手，首次将国产通用GPU与类脑芯片深度融合，打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型AF分离推理模式：将Attention（注意力）计算与FFN（前馈网络）模块拆分，由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载，FFN模块交由类脑芯片处理，充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势，突破传统GPU推理瓶颈。\n同时，团队自研的模型编译器、高速互联协议和统一推理引擎，可完成两类算力的任务拆解、协同调度、结果聚合，真正实现了两种架构算力优势互补。项目已在DeepSeek-V4-Flash大模型上完成完整调优验证，相较同类国产GPU算力集群，推理输出和能效均提升1倍以上，业务运营成本降低超40％。\n这意味着，移动云依托国内成熟工艺的国产芯片，通过系统架构创新，具备对标国际下一代推理架构的业务能力，为大模型推理国产化落地提供了可复制的技术范式。\n产学研协同共建\n面向多场景推进落地开放\n该成果是产学研用协同创新的典型实践，整合运营商、芯片企业、科研院所、高校多方力量，打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续移动云将持续迭代异构推理系统，面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证，并计划将核心异构推理框架逐步开放，赋能国内GPU、类脑芯片厂商及算力运营商，带动国产算力产业链整体发展。\n本次异构混合推理系统在中国算力大会首发，为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束，这一方案也为国内AI算力自主发展提供重要的创新参考方向。","source":"新浪财经","date":"2026-09-18T20:48:45+00:00","content":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）\n2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。\n大模型推理进入爆发期\n传统架构遭遇双重瓶颈\n随着人工智能产业重心从模型训练转向规模化推理服务，推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求，传统单一GPU推理架构越来越吃力。一方面，数据频繁搬运会带来“内存墙”和“功耗墙”；另一方面，国内先进芯片制程供给受限，单纯靠硬件工艺升级提升算力，空间有限。行业需要跳出“只追先进制程”的思路，从系统架构层面寻找新解法。\n国产GPU与类脑芯片分工\n混合推理技术实现突破\n项目团队从系统架构创新入手，首次将国产通用GPU与类脑芯片深度融合，打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型AF分离推理模式：将Attention（注意力）计算与FFN（前馈网络）模块拆分，由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载，FFN模块交由类脑芯片处理，充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势，突破传统GPU推理瓶颈。\n同时，团队自研的模型编译器、高速互联协议和统一推理引擎，可完成两类算力的任务拆解、协同调度、结果聚合，真正实现了两种架构算力优势互补。项目已在DeepSeek-V4-Flash大模型上完成完整调优验证，相较同类国产GPU算力集群，推理输出和能效均提升1倍以上，业务运营成本降低超40％。\n这意味着，移动云依托国内成熟工艺的国产芯片，通过系统架构创新，具备对标国际下一代推理架构的业务能力，为大模型推理国产化落地提供了可复制的技术范式。\n产学研协同共建\n面向多场景推进落地开放\n该成果是产学研用协同创新的典型实践，整合运营商、芯片企业、科研院所、高校多方力量，打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续移动云将持续迭代异构推理系统，面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证，并计划将核心异构推理框架逐步开放，赋能国内GPU、类脑芯片厂商及算力运营商，带动国产算力产业链整体发展。\n本次异构混合推理系统在中国算力大会首发，为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束，这一方案也为国内AI算力自主发展提供重要的创新参考方向。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html%3Fvt%3D4","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 1171 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1171 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1171,"summary_length":1171,"usable_text_length":1171,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1171,"summary_length":1171}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/85491","export_markdown":"/api/items/85491/export?format=markdown","export_json":"/api/items/85491/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html%3Fvt%3D4"},"formats":{"full":{"id":85491,"title":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片） - 新浪财经","url":"https://finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html?vt=4","source":"新浪财经","author":null,"published_at":"2026-09-18T20:48:45+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）\n2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。\n大模型推理进入爆发期\n传统架构遭遇双重瓶颈\n随着人工智能产业重心从模型训练转向规模化推理服务，推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求，传统单一GPU推理架构越来越吃力。一方面，数据频繁搬运会带来“内存墙”和“功耗墙”；另一方面，国内先进芯片制程供给受限，单纯靠硬件工艺升级提升算力，空间有限。行业需要跳出“只追先进制程”的思路，从系统架构层面寻找新解法。\n国产GPU与类脑芯片分工\n混合推理技术实现突破\n项目团队从系统架构创新入手，首次将国产通用GPU与类脑芯片深度融合，打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型AF分离推理模式：将Attention（注意力）计算与FFN（前馈网络）模块拆分，由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载，FFN模块交由类脑芯片处理，充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势，突破传统GPU推理瓶颈。\n同时，团队自研的模型编译器、高速互联协议和统一推理引擎，可完成两类算力的任务拆解、协同调度、结果聚合，真正实现了两种架构算力优势互补。项目已在DeepSeek-V4-Flash大模型上完成完整调优验证，相较同类国产GPU算力集群，推理输出和能效均提升1倍以上，业务运营成本降低超40％。\n这意味着，移动云依托国内成熟工艺的国产芯片，通过系统架构创新，具备对标国际下一代推理架构的业务能力，为大模型推理国产化落地提供了可复制的技术范式。\n产学研协同共建\n面向多场景推进落地开放\n该成果是产学研用协同创新的典型实践，整合运营商、芯片企业、科研院所、高校多方力量，打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续移动云将持续迭代异构推理系统，面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证，并计划将核心异构推理框架逐步开放，赋能国内GPU、类脑芯片厂商及算力运营商，带动国产算力产业链整体发展。\n本次异构混合推理系统在中国算力大会首发，为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束，这一方案也为国内AI算力自主发展提供重要的创新参考方向。","full_text":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）\n2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。\n大模型推理进入爆发期\n传统架构遭遇双重瓶颈\n随着人工智能产业重心从模型训练转向规模化推理服务，推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求，传统单一GPU推理架构越来越吃力。一方面，数据频繁搬运会带来“内存墙”和“功耗墙”；另一方面，国内先进芯片制程供给受限，单纯靠硬件工艺升级提升算力，空间有限。行业需要跳出“只追先进制程”的思路，从系统架构层面寻找新解法。\n国产GPU与类脑芯片分工\n混合推理技术实现突破\n项目团队从系统架构创新入手，首次将国产通用GPU与类脑芯片深度融合，打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型AF分离推理模式：将Attention（注意力）计算与FFN（前馈网络）模块拆分，由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载，FFN模块交由类脑芯片处理，充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势，突破传统GPU推理瓶颈。\n同时，团队自研的模型编译器、高速互联协议和统一推理引擎，可完成两类算力的任务拆解、协同调度、结果聚合，真正实现了两种架构算力优势互补。项目已在DeepSeek-V4-Flash大模型上完成完整调优验证，相较同类国产GPU算力集群，推理输出和能效均提升1倍以上，业务运营成本降低超40％。\n这意味着，移动云依托国内成熟工艺的国产芯片，通过系统架构创新，具备对标国际下一代推理架构的业务能力，为大模型推理国产化落地提供了可复制的技术范式。\n产学研协同共建\n面向多场景推进落地开放\n该成果是产学研用协同创新的典型实践，整合运营商、芯片企业、科研院所、高校多方力量，打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续移动云将持续迭代异构推理系统，面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证，并计划将核心异构推理框架逐步开放，赋能国内GPU、类脑芯片厂商及算力运营商，带动国产算力产业链整体发展。\n本次异构混合推理系统在中国算力大会首发，为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束，这一方案也为国内AI算力自主发展提供重要的创新参考方向。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 1171 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html%3Fvt%3D4","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1171 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1171,"summary_length":1171,"usable_text_length":1171,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1171,"summary_length":1171}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1171 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1171,"summary_length":1171,"usable_text_length":1171,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1171,"summary_length":1171}},"actions":{"read":"/item/85491","export_markdown":"/api/items/85491/export?format=markdown","export_json":"/api/items/85491/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html%3Fvt%3D4"}},"digest":{"id":85491,"title":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片） - 新浪财经","url":"https://finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html?vt=4","source":"新浪财经","topic":"ai","published_at":"2026-09-18T20:48:45+00:00","excerpt":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片） 2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。 大模型推理进入爆发期 传统架构遭遇双重瓶颈…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 1171 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片） - 新浪财经","subtitle":"新浪财经 · 2026-09-18","summary":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片） 2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。 大模型推理进入爆发期…","badges":["quality:high"],"links":{"read":"/item/85491","original":"https://finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html?vt=4","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html%3Fvt%3D4"},"quality_warning":null},"export":{"title":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片） - 新浪财经","url":"https://finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html?vt=4","summary":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）\n2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。\n大模型推理进入爆发期\n传统架构遭遇双重瓶颈\n随着人工智能产业重心从模型训练转向规模化推理服务，推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求，传统单一GPU推理架构越来越吃力。一方面，数据频繁搬运会带来“内存墙”和“功耗墙”；另一方面，国内先进芯片制程供给受限，单纯靠硬件工艺升级提升算力，空间有限。行业需要跳出“只追先进制程”的思路，从系统架构层面寻找新解法。\n国产GPU与类脑芯片分工\n混合推理技术实现突破\n项目团队从系统架构创新入手，首次将国产通用GPU与类脑芯片深度融合，打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型AF分离推理模式：将Attention（注意力）计算与FFN（前馈网络）模块拆分，由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载，FFN模块交由类脑芯片处理，充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势，突破传统GPU推理瓶颈。\n同时，团队自研的模型编译器、高速互联协议和统一推理引擎，可完成两类算力的任务拆解、协同调度、结果聚合，真正实现了两种架构算力优势互补。项目已在DeepSeek-V4-Flash大模型上完成完整调优验证，相较同类国产GPU算力集群，推理输出和能效均提升1倍以上，业务运营成本降低超40％。\n这意味着，移动云依托国内成熟工艺的国产芯片，通过系统架构创新，具备对标国际下一代推理架构的业务能力，为大模型推理国产化落地提供了可复制的技术范式。\n产学研协同共建\n面向多场景推进落地开放\n该成果是产学研用协同创新的典型实践，整合运营商、芯片企业、科研院所、高校多方力量，打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续移动云将持续迭代异构推理系统，面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证，并计划将核心异构推理框架逐步开放，赋能国内GPU、类脑芯片厂商及算力运营商，带动国产算力产业链整体发展。\n本次异构混合推理系统在中国算力大会首发，为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束，这一方案也为国内AI算力自主发展提供重要的创新参考方向。","source":"新浪财经","date":"2026-09-18T20:48:45+00:00","content":"移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统（附图片）\n2026中国算力大会“算力首创首发发布会”专场上，由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新，让国产芯片也能高效支撑大模型推理，为国内大模型、多智能体应用提供了一条自主可控的新算力路径。\n大模型推理进入爆发期\n传统架构遭遇双重瓶颈\n随着人工智能产业重心从模型训练转向规模化推理服务，推理算力已经成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量、能耗成本提出极高要求，传统单一GPU推理架构越来越吃力。一方面，数据频繁搬运会带来“内存墙”和“功耗墙”；另一方面，国内先进芯片制程供给受限，单纯靠硬件工艺升级提升算力，空间有限。行业需要跳出“只追先进制程”的思路，从系统架构层面寻找新解法。\n国产GPU与类脑芯片分工\n混合推理技术实现突破\n项目团队从系统架构创新入手，首次将国产通用GPU与类脑芯片深度融合，打造对标英伟达下一代国际先进异构推理方案的国产化系统。创新实现Transformer模型AF分离推理模式：将Attention（注意力）计算与FFN（前馈网络）模块拆分，由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载，FFN模块交由类脑芯片处理，充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势，突破传统GPU推理瓶颈。\n同时，团队自研的模型编译器、高速互联协议和统一推理引擎，可完成两类算力的任务拆解、协同调度、结果聚合，真正实现了两种架构算力优势互补。项目已在DeepSeek-V4-Flash大模型上完成完整调优验证，相较同类国产GPU算力集群，推理输出和能效均提升1倍以上，业务运营成本降低超40％。\n这意味着，移动云依托国内成熟工艺的国产芯片，通过系统架构创新，具备对标国际下一代推理架构的业务能力，为大模型推理国产化落地提供了可复制的技术范式。\n产学研协同共建\n面向多场景推进落地开放\n该成果是产学研用协同创新的典型实践，整合运营商、芯片企业、科研院所、高校多方力量，打通了从底层芯片适配、推理引擎开发到业务场景验证的完整链条。后续移动云将持续迭代异构推理系统，面向Token工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证，并计划将核心异构推理框架逐步开放，赋能国内GPU、类脑芯片厂商及算力运营商，带动国产算力产业链整体发展。\n本次异构混合推理系统在中国算力大会首发，为智能体时代的AI推理提供国产化全新算力底座。以架构创新弥补工艺约束，这一方案也为国内AI算力自主发展提供重要的创新参考方向。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/2026-09-18/detail-inisewti3563276.d.html%3Fvt%3D4","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 1171 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1171 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1171,"summary_length":1171,"usable_text_length":1171,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1171,"summary_length":1171}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}