# 科大讯飞发布Spark-Audio-1.0-Preview，全国产语音基座大模型实现从“听清”到“听懂”-AI云资讯 - icloudnews.net

*Источник: icloudnews.net*
*Дата: 2026-09-16*
*Язык: zh*

**Кратко:** 科大讯飞发布Spark-Audio-1.0-Preview，全国产语音基座大模型实现从“听清”到“听懂”
2026/09/16 18:05AI云资讯9963
9月16日，科大讯飞发布基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview，支持文本和语音两个模态的输入以及文本模态的输出，可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等场景任务的实现，使智能语音完成从“听清”到“听懂”的跃升。
Spark-Audio-1.0-Preview采用 0.65B（Dense结构）的音频编码器，搭配30B-A3B（MoE结构）的大语言模型，使用了1300万小时音频以及大量文本数据，基于纯国产算力集群训练完成。在训练数据量仅相当于同尺寸模型Qwen3.5-omni-Flash十分之一的情况下，Spark-Audio-1.0-Preview在各项语音评测任务上效果整体相当、部分超过，尤其在偏真实应用类任务上明显领先；与尺寸更大的闭源语音基座模型效果接近。
Spark-Audio-1.0-Preview可支持99种语言及202种方言的识别。在Fleurs、KeSpeech、LibriSpeech等中英文、多语言、多方言语音识别评测任务中，Spark-Audio-1.0-Preview得分高于Gemini-3.1 Pro；Fleurs-中文测试集中，Spark-Audio-1.0-Preview取得了SOTA；面向更实际的应用场景，Spark-Audio-1.0-Preview在高噪声、小音量等复杂条件下的语音识别评测任务中也有较为明显的领先优势。
同时，Spark-Audio-1.0-Preview在通用知识、数学与代码等任务上没有出现明显降智，在指令遵循、对话、音频理解等任务上仍有进步追赶空间。
公开测试集-音频
自建测试集-音频
自建测试集-音频-复杂场景
公开测试集-文本
据了解，Spark-Audio-1.0-Preview通过音频编码器预训练，逐步扩展音频编码器的表征能力；再通过预训练和后训练，提升了模型的基础能力、复杂场景泛化性以及多个任务效果，最终在99种语言、202 种方言及高噪声、小音量等复杂场景下取得优异成绩。作为业界首个基于全国产算力训练的语音基座大模型，Spark-Audio-1.0-Preview也证明了在国产算力上完全有能力训练出效果达到业界领先水平的语音基座大模型。
Spark-Audio-1.0-Preview可在实际应用场景任务上带来更好效果，如增强人机交互系统的情绪感知和多轮对话理解能力，保留语气韵律信息、带来更流畅的同传体验，提升医疗电子病历、会议转写与内容审核系统自动区分说话人、提取关键决策点及生成结构化纪要的效果。
目前，Spark-Audio-1.0-Preview已正式开放体验入口，API后续将上线讯飞开放平台；基于Spark-Audio-1.0-Preview语音基座大模型，科大讯飞还将在近期陆续展开一系列语音相关大模型的发布和升级。
相关文章
- 科大讯飞发布Spark-Audio-1.0-Preview，全国产语音基座大模型实现从“听清”到“听懂”
- 科大讯飞参加2026中国联通合作伙伴大会，携手共建AI产业新生态
- 科大讯飞亮相IFA 2026：以人工智能连接全球沟通与智慧生活
- 科大讯飞与海光信息共建“星光联合实验室”
- 科大讯飞数字人平台升级，首发超拟人数字人实时生成
- 科大讯飞联合主办WAIC法律大模型分论坛 星火晓法超级智能体首次发布
- 科大讯飞娄超：助力国产智能终端实现“智能原生”范式跃迁
- 科大讯飞AI学习机亮相WAIC 2026：做孩子的“智能伙伴”，让因材施教触手可及
- 科大讯飞发布招采全链路AI智能体平台 招采行业迈入AI原生新阶段
- 科大讯飞与万新光学集团达成战略合作，共筑AI眼镜产业新生态
- 讯飞AI眼镜登场 科大讯飞自主可控软硬一体战略再落一子
- 自主可控 智测未来｜科大讯飞人工智能终端测试中心正式揭牌
- 科大讯飞发布玲珑Agent OS，让AI真正走进企业核心业务流
- 2026中国翻译协会年会召开，科大讯飞携多语言AI翻译产品矩阵亮相并获评5A级企业认证
- 科大讯飞佛山人工智能产业基地正式启用，助力南海构建AI产业生态
- 科大讯飞重磅布局智能穿戴，讯飞AI眼镜开启跨语言沟通新时代
- 科大讯飞发布Spark-Audio-1.0-Preview，全国产语音基座大模型实现从“听清”到“听懂”
- 全球最强开源模型 Kimi K3 发布，参数规模 3 万亿，真的是强！
- 范式变革！东软发布AI原生软件工程白皮书，重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布：从“写代码”迈向“做工程”，Agentic能力全面升级
- 自变量机器人王昊：训练世界模型需付出“时间税”，解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security，用AI Agent实现更高效的代码审计
- Twinkle x昇腾，率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI，告别传统 UI 开发模式

科大讯飞发布Spark-Audio-1.0-Preview，全国产语音基座大模型实现从“听清”到“听懂”
2026/09/16 18:05AI云资讯9963
9月16日，科大讯飞发布基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview，支持文本和语音两个模态的输入以及文本模态的输出，可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等场景任务的实现，使智能语音完成从“听清”到“听懂”的跃升。
Spark-Audio-1.0-Preview采用 0.65B（Dense结构）的音频编码器，搭配30B-A3B（MoE结构）的大语言模型，使用了1300万小时音频以及大量文本数据，基于纯国产算力集群训练完成。在训练数据量仅相当于同尺寸模型Qwen3.5-omni-Flash十分之一的情况下，Spark-Audio-1.0-Preview在各项语音评测任务上效果整体相当、部分超过，尤其在偏真实应用类任务上明显领先；与尺寸更大的闭源语音基座模型效果接近。
Spark-Audio-1.0-Preview可支持99种语言及202种方言的识别。在Fleurs、KeSpeech、LibriSpeech等中英文、多语言、多方言语音识别评测任务中，Spark-Audio-1.0-Preview得分高于Gemini-3.1 Pro；Fleurs-中文测试集中，Spark-Audio-1.0-Preview取得了SOTA；面向更实际的应用场景，Spark-Audio-1.0-Preview在高噪声、小音量等复杂条件下的语音识别评测任务中也有较为明显的领先优势。
同时，Spark-Audio-1.0-Preview在通用知识、数学与代码等任务上没有出现明显降智，在指令遵循、对话、音频理解等任务上仍有进步追赶空间。
公开测试集-音频
自建测试集-音频
自建测试集-音频-复杂场景
公开测试集-文本
据了解，Spark-Audio-1.0-Preview通过音频编码器预训练，逐步扩展音频编码器的表征能力；再通过预训练和后训练，提升了模型的基础能力、复杂场景泛化性以及多个任务效果，最终在99种语言、202 种方言及高噪声、小音量等复杂场景下取得优异成绩。作为业界首个基于全国产算力训练的语音基座大模型，Spark-Audio-1.0-Preview也证明了在国产算力上完全有能力训练出效果达到业界领先水平的语音基座大模型。
Spark-Audio-1.0-Preview可在实际应用场景任务上带来更好效果，如增强人机交互系统的情绪感知和多轮对话理解能力，保留语气韵律信息、带来更流畅的同传体验，提升医疗电子病历、会议转写与内容审核系统自动区分说话人、提取关键决策点及生成结构化纪要的效果。
目前，Spark-Audio-1.0-Preview已正式开放体验入口，API后续将上线讯飞开放平台；基于Spark-Audio-1.0-Preview语音基座大模型，科大讯飞还将在近期陆续展开一系列语音相关大模型的发布和升级。
相关文章
- 科大讯飞发布Spark-Audio-1.0-Preview，全国产语音基座大模型实现从“听清”到“听懂”
- 科大讯飞参加2026中国联通合作伙伴大会，携手共建AI产业新生态
- 科大讯飞亮相IFA 2026：以人工智能连接全球沟通与智慧生活
- 科大讯飞与海光信息共建“星光联合实验室”
- 科大讯飞数字人平台升级，首发超拟人数字人实时生成
- 科大讯飞联合主办WAIC法律大模型分论坛 星火晓法超级智能体首次发布
- 科大讯飞娄超：助力国产智能终端实现“智能原生”范式跃迁
- 科大讯飞AI学习机亮相WAIC 2026：做孩子的“智能伙伴”，让因材施教触手可及
- 科大讯飞发布招采全链路AI智能体平台 招采行业迈入AI原生新阶段
- 科大讯飞与万新光学集团达成战略合作，共筑AI眼镜产业新生态
- 讯飞AI眼镜登场 科大讯飞自主可控软硬一体战略再落一子
- 自主可控 智测未来｜科大讯飞人工智能终端测试中心正式揭牌
- 科大讯飞发布玲珑Agent OS，让AI真正走进企业核心业务流
- 2026中国翻译协会年会召开，科大讯飞携多语言AI翻译产品矩阵亮相并获评5A级企业认证
- 科大讯飞佛山人工智能产业基地正式启用，助力南海构建AI产业生态
- 科大讯飞重磅布局智能穿戴，讯飞AI眼镜开启跨语言沟通新时代
- 科大讯飞发布Spark-Audio-1.0-Preview，全国产语音基座大模型实现从“听清”到“听懂”
- 全球最强开源模型 Kimi K3 发布，参数规模 3 万亿，真的是强！
- 范式变革！东软发布AI原生软件工程白皮书，重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布：从“写代码”迈向“做工程”，Agentic能力全面升级
- 自变量机器人王昊：训练世界模型需付出“时间税”，解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security，用AI Agent实现更高效的代码审计
- Twinkle x昇腾，率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI，告别传统 UI 开发模式

[Оригинал](https://www.icloudnews.net/a/122667.html)