{"id":48578,"topic":"ai","source":"凤凰网","title":"摩尔线程宣布完成Kimi K3适配：MTT S5000国产GPU支撑2.8万亿参数大模型 - 凤凰网","url":"https://i.ifeng.com/c/8v9Pk7oqk3l","url_hash":"eb64382b68b0dd3fe66126e407c54776087ff429","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiSEFVX3lxTE5BT2Q2OXl3bmNody1fVTRpTllGOHZFMXNDNl9sSEdXQjNVX2lIczlyWWM2OG53NldlZWxrbjdtRzBhUWdaOEJscA?oc=5\" target=\"_blank\">摩尔线程宣布完成Kimi K3适配：MTT S5000国产GPU支撑2.8万亿参数大模型</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">凤凰网</font>","content":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。\n同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。\nKimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。\n与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。\n面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。\n针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。\nIT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","image_url":"https://x0.ifengimg.com/ucms/2026_31/93A2E6B93B0E15CB7E67692A069DC90DD4CC2763_size1039_w975_h549.png","lang":"zh","published_at":"2026-07-29T03:20:11+00:00","fetched_at":"2026-07-29T04:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。\n同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。\nKimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。\n与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。\n面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。\n针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。\nIT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://i.ifeng.com/c/8v9Pk7oqk3l","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1367 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1367,"summary_length":1367,"usable_text_length":1367,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1367,"summary_length":1367}},"news_item":{"id":48578,"canonical_url":"https://i.ifeng.com/c/8v9Pk7oqk3l","source_url":"https://i.ifeng.com/c/8v9Pk7oqk3l","title":"摩尔线程宣布完成Kimi K3适配：MTT S5000国产GPU支撑2.8万亿参数大模型 - 凤凰网","source_name":"凤凰网","author":null,"published_at":"2026-07-29T03:20:11+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiSEFVX3lxTE5BT2Q2OXl3bmNody1fVTRpTllGOHZFMXNDNl9sSEdXQjNVX2lIczlyWWM2OG53NldlZWxrbjdtRzBhUWdaOEJscA?oc=5\" target=\"_blank\">摩尔线程宣布完成Kimi K3适配：MTT S5000国产GPU支撑2.8万亿参数大模型</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">凤凰网</font>","full_text":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。\n同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。\nKimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。\n与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。\n面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。\n针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。\nIT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","excerpt":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。\n同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。\nKimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。\n与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。\n面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。\n针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。\nIT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 1367 characters.","diagnostics_url":"/api/diagnose?url=https%3A//i.ifeng.com/c/8v9Pk7oqk3l","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1367 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1367,"summary_length":1367,"usable_text_length":1367,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1367,"summary_length":1367}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"摩尔线程宣布完成Kimi K3适配：MTT S5000国产GPU支撑2.8万亿参数大模型 - 凤凰网","url":"https://i.ifeng.com/c/8v9Pk7oqk3l","summary":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。\n同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。\nKimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。\n与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。\n面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。\n针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。\nIT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","source":"凤凰网","date":"2026-07-29T03:20:11+00:00","content":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。\n同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。\nKimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。\n与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。\n面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。\n针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。\nIT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//i.ifeng.com/c/8v9Pk7oqk3l","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 1367 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1367 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1367,"summary_length":1367,"usable_text_length":1367,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1367,"summary_length":1367}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/48578","export_markdown":"/api/items/48578/export?format=markdown","export_json":"/api/items/48578/export?format=json","diagnose":"/api/diagnose?url=https%3A//i.ifeng.com/c/8v9Pk7oqk3l"},"formats":{"full":{"id":48578,"title":"摩尔线程宣布完成Kimi K3适配：MTT S5000国产GPU支撑2.8万亿参数大模型 - 凤凰网","url":"https://i.ifeng.com/c/8v9Pk7oqk3l","source":"凤凰网","author":null,"published_at":"2026-07-29T03:20:11+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。\n同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。\nKimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。\n与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。\n面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。\n针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。\nIT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","full_text":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。\n同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。\nKimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。\n与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。\n面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。\n针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。\nIT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 1367 characters.","diagnostics_url":"/api/diagnose?url=https%3A//i.ifeng.com/c/8v9Pk7oqk3l","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1367 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1367,"summary_length":1367,"usable_text_length":1367,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1367,"summary_length":1367}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1367 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1367,"summary_length":1367,"usable_text_length":1367,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1367,"summary_length":1367}},"actions":{"read":"/item/48578","export_markdown":"/api/items/48578/export?format=markdown","export_json":"/api/items/48578/export?format=json","diagnose":"/api/diagnose?url=https%3A//i.ifeng.com/c/8v9Pk7oqk3l"}},"digest":{"id":48578,"title":"摩尔线程宣布完成Kimi K3适配：MTT S5000国产GPU支撑2.8万亿参数大模型 - 凤凰网","url":"https://i.ifeng.com/c/8v9Pk7oqk3l","source":"凤凰网","topic":"ai","published_at":"2026-07-29T03:20:11+00:00","excerpt":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。 同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。 Kimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 1367 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"摩尔线程宣布完成Kimi K3适配：MTT S5000国产GPU支撑2.8万亿参数大模型 - 凤凰网","subtitle":"凤凰网 · 2026-07-29","summary":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。 同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。 Kimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta…","badges":["quality:high"],"links":{"read":"/item/48578","original":"https://i.ifeng.com/c/8v9Pk7oqk3l","diagnose":"/api/diagnose?url=https%3A//i.ifeng.com/c/8v9Pk7oqk3l"},"quality_warning":null},"export":{"title":"摩尔线程宣布完成Kimi K3适配：MTT S5000国产GPU支撑2.8万亿参数大模型 - 凤凰网","url":"https://i.ifeng.com/c/8v9Pk7oqk3l","summary":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。\n同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。\nKimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。\n与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。\n面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。\n针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。\nIT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","source":"凤凰网","date":"2026-07-29T03:20:11+00:00","content":"IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。\n同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。\nKimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。\n与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。\n面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。\n针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。\nIT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//i.ifeng.com/c/8v9Pk7oqk3l","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 1367 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1367 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1367,"summary_length":1367,"usable_text_length":1367,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1367,"summary_length":1367}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}