# 语音大模型赛道持续升温 云知声完成U2-ASR、U2-TTS多语种升级 - 东方财富

*Источник: 东方财富*
*Дата: 2026-07-28*
*Язык: zh*

**Кратко:** 《科创板日报》7月28日讯2026年的AI行业正处在一个关键的转折点上。行业焦点正从“谁更会聊天”转向“谁能把事干成”。语音AI赛道随之加速升温，更强的语音识别能力成为各大模型厂商的关注点。
云知声今日公告，其U2-ASR语音识别与U2-TTS语音合成模型已完成多语种能力全面升级。其中，ASR模块新增支持13种国际语言识别，TTS模块新增8种东南亚语言合成。至此，U2语音大模型已覆盖超过100种中国方言及15种以上国际语言，在语音大模型领域形成从本土方言到全球多语种的拓展。
在具体升级方面， U2-ASR进一步拓展统一多语种联合建模架构，新增支持：阿拉伯语、德语、西班牙语、法语、印尼语、日语、韩语、葡萄牙语、俄语、土耳其语、越南语、泰语、意大利语等13种国际语言。U2-TTS重点强化东南亚多语种语音合成能力，新增支持：泰语、越南语、印尼语、马来语、缅甸语、柬埔寨语、菲律宾语、老挝语等8种语言。
测试显示，U2-ASR在13种语言工业级测试集上的平均字错率（CER）低至6.58%，12种语言CER低于8%，德语、西班牙语、印尼语、意大利语、越南语等5个重点语种进入5%以内。
从行业视角看，全球AI语音技术资源长期集中于中文、英文等大语种，部分发展中国家及语言资源有限的市场，仍面临训练数据不足、模型建设成本高企、优质服务供给有限等制约。
行业研究机构Data Bridge Market Research的报告显示，全球低资源语言AI模型市场预计将从2025年的48.7亿美元增长至2033年的169.2亿美元。与此同时，中国AI企业出海对多语种语音基础设施的需求正在快速释放。云知声通过“一个模型、一套接口”降低多语种部署门槛，在技术供给与市场需求之间找到了一个相对清晰的切入点。
目前，完成升级的U2-ASR 与 U2-TTS 已全量上线云知声TokenHub大模型服务平台，并开放标准API，支持开发者与企业根据业务需求调用。
根据此前的业绩预告，云知声预计2026年上半年营收为5.3亿到5.8亿，较上年同期增长31%到43%。
分业务来看，依托大模型能力的智能体业务预计上半年实现收入5.15亿元至5.50亿元，较2025年同期增长200%至220%；
公司今年新拓展的大模型Token直接调用业务2026年上半年预计收入约3000万元，毛利率不低于60%，其中2026年第二季度Token调用收入约2500万元，相较2026年第一季度环比增长约500%。
值得关注的是，语音大模型赛道的竞争正在升温。头部厂商纷纷押注语音大模型。7月20日，字节跳动Seed团队正式发布音频创作模型Seed Audio 1.0。同日，阿里千问推出语音合成大模型Qwen-Audio-3.0-TTS。此外，OpenAI在今年陆续推出GPT-Live和GPT-Realtime-2。Google、微软
云知声在多语种和方言上的差异化优势，能否在巨头的挤压下持续转化为商业壁垒，仍是一个开放性问题。从业绩数据来看，云知声从技术到商业的转化正在加速，但仍面临激烈的行业竞争、持续的亏损压力。
正如云知声创始人黄伟所言，2023年至2025年是大模型发展的“热身赛”，2026年才进入真正竞争阶段。不同AGI路线最终都需要回答同一个问题：技术能力如何转化为商业回报。能否在持续烧钱与自我造血之间找到可持续的平衡点，这既是云知声的命题，也是整个AI行业正在面对的集体考题。
（文章来源：科创板日报）

《科创板日报》7月28日讯2026年的AI行业正处在一个关键的转折点上。行业焦点正从“谁更会聊天”转向“谁能把事干成”。语音AI赛道随之加速升温，更强的语音识别能力成为各大模型厂商的关注点。
云知声今日公告，其U2-ASR语音识别与U2-TTS语音合成模型已完成多语种能力全面升级。其中，ASR模块新增支持13种国际语言识别，TTS模块新增8种东南亚语言合成。至此，U2语音大模型已覆盖超过100种中国方言及15种以上国际语言，在语音大模型领域形成从本土方言到全球多语种的拓展。
在具体升级方面， U2-ASR进一步拓展统一多语种联合建模架构，新增支持：阿拉伯语、德语、西班牙语、法语、印尼语、日语、韩语、葡萄牙语、俄语、土耳其语、越南语、泰语、意大利语等13种国际语言。U2-TTS重点强化东南亚多语种语音合成能力，新增支持：泰语、越南语、印尼语、马来语、缅甸语、柬埔寨语、菲律宾语、老挝语等8种语言。
测试显示，U2-ASR在13种语言工业级测试集上的平均字错率（CER）低至6.58%，12种语言CER低于8%，德语、西班牙语、印尼语、意大利语、越南语等5个重点语种进入5%以内。
从行业视角看，全球AI语音技术资源长期集中于中文、英文等大语种，部分发展中国家及语言资源有限的市场，仍面临训练数据不足、模型建设成本高企、优质服务供给有限等制约。
行业研究机构Data Bridge Market Research的报告显示，全球低资源语言AI模型市场预计将从2025年的48.7亿美元增长至2033年的169.2亿美元。与此同时，中国AI企业出海对多语种语音基础设施的需求正在快速释放。云知声通过“一个模型、一套接口”降低多语种部署门槛，在技术供给与市场需求之间找到了一个相对清晰的切入点。
目前，完成升级的U2-ASR 与 U2-TTS 已全量上线云知声TokenHub大模型服务平台，并开放标准API，支持开发者与企业根据业务需求调用。
根据此前的业绩预告，云知声预计2026年上半年营收为5.3亿到5.8亿，较上年同期增长31%到43%。
分业务来看，依托大模型能力的智能体业务预计上半年实现收入5.15亿元至5.50亿元，较2025年同期增长200%至220%；
公司今年新拓展的大模型Token直接调用业务2026年上半年预计收入约3000万元，毛利率不低于60%，其中2026年第二季度Token调用收入约2500万元，相较2026年第一季度环比增长约500%。
值得关注的是，语音大模型赛道的竞争正在升温。头部厂商纷纷押注语音大模型。7月20日，字节跳动Seed团队正式发布音频创作模型Seed Audio 1.0。同日，阿里千问推出语音合成大模型Qwen-Audio-3.0-TTS。此外，OpenAI在今年陆续推出GPT-Live和GPT-Realtime-2。Google、微软
云知声在多语种和方言上的差异化优势，能否在巨头的挤压下持续转化为商业壁垒，仍是一个开放性问题。从业绩数据来看，云知声从技术到商业的转化正在加速，但仍面临激烈的行业竞争、持续的亏损压力。
正如云知声创始人黄伟所言，2023年至2025年是大模型发展的“热身赛”，2026年才进入真正竞争阶段。不同AGI路线最终都需要回答同一个问题：技术能力如何转化为商业回报。能否在持续烧钱与自我造血之间找到可持续的平衡点，这既是云知声的命题，也是整个AI行业正在面对的集体考题。
（文章来源：科创板日报）

[Оригинал](https://finance.eastmoney.com/a/202607283823307523.html)