{"id":84397,"topic":"ai","source":"InfoQ-CN","title":"阶跃发布全新语音大模型 StepAudio 3 系列：覆盖语音识别、生成、实时交互与音乐创作 - InfoQ-CN","url":"https://www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","url_hash":"aaa6c1a0149a9823169390c6955fe55796cf263f","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiXkFVX3lxTE5HR1hUeWZUWE5vbzF1em5rdmRPR2VNclNiM3JRSHU3b0F1dXJQYjN5M05jaHdsVjI3enhqaGFXNUI3Umc2cXllWkFVTm5UYXdXbGVUeHc0SzBGVHhPbWc?oc=5\" target=\"_blank\">阶跃发布全新语音大模型 StepAudio 3 系列：覆盖语音识别、生成、实时交互与音乐创作</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">InfoQ-CN</font>","content":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。\n其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。\n相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力，让 AI 不仅能够“听”和“说”，也能够理解声音背后的语义与情绪，并参与更完整的交互和内容生产过程。\n其中，面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话，可以在持续交流过程中判断何时回应、何时等待，并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中，该模型以 98.9%的综合得分排名全球第一。\n与传统实时语音模型主要追求低延迟和自然对话不同，StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音，并支持推理与语音生成并行；Tool Call 和长任务则可以异步执行，在任务运行期间不打断当前对话。\n其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。\n在语音识别方面，StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合，不仅要解决“听清楚”，也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。\n该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景，并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中，StepAudio 3 ASR 的 WER（词错误率）为 1.7%，并列全球第一。\n除实时交互和语音识别外，此次发布也进一步拓展了语音生成模型的能力边界。\nStepAudio 3 TTS 面向真人级语音生成，在音色、语调、节奏、停顿和情绪表达之外，还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构，可实现生成与播放同时进行，满足实时语音应用需求。\nStepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情，一次生成包含多种声音元素的完整音频，并控制角色音色、情绪以及不同声音出现的时间与顺序，广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。\n面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”，而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代，使 AI 更深入参与实际音乐生产流程。\n过去一年，语音大模型正从单项的语音识别和生成能力，逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布，阶跃音频模型的产品版图，已经全面覆盖了听、说、理解、推理和创作。\n目前，StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。","image_url":"https://static001.infoq.cn/resource/image/50/33/502fb018f82222ec46a42fe011e12a33.jpg","lang":"zh","published_at":"2026-09-17T08:00:36+00:00","fetched_at":"2026-09-17T08:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。\n其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。\n相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力，让 AI 不仅能够“听”和“说”，也能够理解声音背后的语义与情绪，并参与更完整的交互和内容生产过程。\n其中，面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话，可以在持续交流过程中判断何时回应、何时等待，并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中，该模型以 98.9%的综合得分排名全球第一。\n与传统实时语音模型主要追求低延迟和自然对话不同，StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音，并支持推理与语音生成并行；Tool Call 和长任务则可以异步执行，在任务运行期间不打断当前对话。\n其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。\n在语音识别方面，StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合，不仅要解决“听清楚”，也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。\n该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景，并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中，StepAudio 3 ASR 的 WER（词错误率）为 1.7%，并列全球第一。\n除实时交互和语音识别外，此次发布也进一步拓展了语音生成模型的能力边界。\nStepAudio 3 TTS 面向真人级语音生成，在音色、语调、节奏、停顿和情绪表达之外，还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构，可实现生成与播放同时进行，满足实时语音应用需求。\nStepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情，一次生成包含多种声音元素的完整音频，并控制角色音色、情绪以及不同声音出现的时间与顺序，广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。\n面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”，而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代，使 AI 更深入参与实际音乐生产流程。\n过去一年，语音大模型正从单项的语音识别和生成能力，逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布，阶跃音频模型的产品版图，已经全面覆盖了听、说、理解、推理和创作。\n目前，StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1502 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1502,"summary_length":1502,"usable_text_length":1502,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1502,"summary_length":1502}},"news_item":{"id":84397,"canonical_url":"https://www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","source_url":"https://www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","title":"阶跃发布全新语音大模型 StepAudio 3 系列：覆盖语音识别、生成、实时交互与音乐创作 - InfoQ-CN","source_name":"InfoQ-CN","author":null,"published_at":"2026-09-17T08:00:36+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiXkFVX3lxTE5HR1hUeWZUWE5vbzF1em5rdmRPR2VNclNiM3JRSHU3b0F1dXJQYjN5M05jaHdsVjI3enhqaGFXNUI3Umc2cXllWkFVTm5UYXdXbGVUeHc0SzBGVHhPbWc?oc=5\" target=\"_blank\">阶跃发布全新语音大模型 StepAudio 3 系列：覆盖语音识别、生成、实时交互与音乐创作</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">InfoQ-CN</font>","full_text":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。\n其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。\n相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力，让 AI 不仅能够“听”和“说”，也能够理解声音背后的语义与情绪，并参与更完整的交互和内容生产过程。\n其中，面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话，可以在持续交流过程中判断何时回应、何时等待，并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中，该模型以 98.9%的综合得分排名全球第一。\n与传统实时语音模型主要追求低延迟和自然对话不同，StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音，并支持推理与语音生成并行；Tool Call 和长任务则可以异步执行，在任务运行期间不打断当前对话。\n其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。\n在语音识别方面，StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合，不仅要解决“听清楚”，也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。\n该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景，并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中，StepAudio 3 ASR 的 WER（词错误率）为 1.7%，并列全球第一。\n除实时交互和语音识别外，此次发布也进一步拓展了语音生成模型的能力边界。\nStepAudio 3 TTS 面向真人级语音生成，在音色、语调、节奏、停顿和情绪表达之外，还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构，可实现生成与播放同时进行，满足实时语音应用需求。\nStepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情，一次生成包含多种声音元素的完整音频，并控制角色音色、情绪以及不同声音出现的时间与顺序，广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。\n面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”，而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代，使 AI 更深入参与实际音乐生产流程。\n过去一年，语音大模型正从单项的语音识别和生成能力，逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布，阶跃音频模型的产品版图，已经全面覆盖了听、说、理解、推理和创作。\n目前，StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。","excerpt":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。\n其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。\n相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力，让 AI 不仅能够“听”和“说”，也能够理解声音背后的语义与情绪，并参与更完整的交互和内容生产过程。\n其中，面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话，可以在持续交流过程中判断何时回应、何时等待，并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中，该模型以 98.9%的综合得分排名全球第一。\n与传统实时语音模型主要追求低延迟和自然对话不同，StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音，并支持推理与语音生成并行；Tool Call 和长任务则可以异步执行，在任务运行期间不打断当前对话。\n其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。\n在语音识别方面，StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合，不仅要解决“听清楚”，也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。\n该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景，并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中，StepAudio 3 ASR 的 WER（词错误率）为 1.7%，并列全球第一。\n除实时交互和语音识别外，此次发布也进一步拓展了语音生成模型的能力边界。\nStepAudio 3 TTS 面向真人级语音生成，在音色、语调、节奏、停顿和情绪表达之外，还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构，可实现生成与播放同时进行，满足实时语音应用需求。\nStepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情，一次生成包含多种声音元素的完整音频，并控制角色音色、情绪以及不同声音出现的时间与顺序，广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。\n面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”，而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代，使 AI 更深入参与实际音乐生产流程。\n过去一年，语音大模型正从单项的语音识别和生成能力，逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布，阶跃音频模型的产品版图，已经全面覆盖了听、说、理解、推理和创作。\n目前，StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 1502 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1502 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1502,"summary_length":1502,"usable_text_length":1502,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1502,"summary_length":1502}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"阶跃发布全新语音大模型 StepAudio 3 系列：覆盖语音识别、生成、实时交互与音乐创作 - InfoQ-CN","url":"https://www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","summary":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。\n其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。\n相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力，让 AI 不仅能够“听”和“说”，也能够理解声音背后的语义与情绪，并参与更完整的交互和内容生产过程。\n其中，面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话，可以在持续交流过程中判断何时回应、何时等待，并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中，该模型以 98.9%的综合得分排名全球第一。\n与传统实时语音模型主要追求低延迟和自然对话不同，StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音，并支持推理与语音生成并行；Tool Call 和长任务则可以异步执行，在任务运行期间不打断当前对话。\n其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。\n在语音识别方面，StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合，不仅要解决“听清楚”，也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。\n该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景，并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中，StepAudio 3 ASR 的 WER（词错误率）为 1.7%，并列全球第一。\n除实时交互和语音识别外，此次发布也进一步拓展了语音生成模型的能力边界。\nStepAudio 3 TTS 面向真人级语音生成，在音色、语调、节奏、停顿和情绪表达之外，还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构，可实现生成与播放同时进行，满足实时语音应用需求。\nStepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情，一次生成包含多种声音元素的完整音频，并控制角色音色、情绪以及不同声音出现的时间与顺序，广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。\n面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”，而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代，使 AI 更深入参与实际音乐生产流程。\n过去一年，语音大模型正从单项的语音识别和生成能力，逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布，阶跃音频模型的产品版图，已经全面覆盖了听、说、理解、推理和创作。\n目前，StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。","source":"InfoQ-CN","date":"2026-09-17T08:00:36+00:00","content":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。\n其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。\n相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力，让 AI 不仅能够“听”和“说”，也能够理解声音背后的语义与情绪，并参与更完整的交互和内容生产过程。\n其中，面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话，可以在持续交流过程中判断何时回应、何时等待，并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中，该模型以 98.9%的综合得分排名全球第一。\n与传统实时语音模型主要追求低延迟和自然对话不同，StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音，并支持推理与语音生成并行；Tool Call 和长任务则可以异步执行，在任务运行期间不打断当前对话。\n其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。\n在语音识别方面，StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合，不仅要解决“听清楚”，也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。\n该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景，并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中，StepAudio 3 ASR 的 WER（词错误率）为 1.7%，并列全球第一。\n除实时交互和语音识别外，此次发布也进一步拓展了语音生成模型的能力边界。\nStepAudio 3 TTS 面向真人级语音生成，在音色、语调、节奏、停顿和情绪表达之外，还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构，可实现生成与播放同时进行，满足实时语音应用需求。\nStepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情，一次生成包含多种声音元素的完整音频，并控制角色音色、情绪以及不同声音出现的时间与顺序，广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。\n面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”，而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代，使 AI 更深入参与实际音乐生产流程。\n过去一年，语音大模型正从单项的语音识别和生成能力，逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布，阶跃音频模型的产品版图，已经全面覆盖了听、说、理解、推理和创作。\n目前，StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 1502 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1502 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1502,"summary_length":1502,"usable_text_length":1502,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1502,"summary_length":1502}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/84397","export_markdown":"/api/items/84397/export?format=markdown","export_json":"/api/items/84397/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC"},"formats":{"full":{"id":84397,"title":"阶跃发布全新语音大模型 StepAudio 3 系列：覆盖语音识别、生成、实时交互与音乐创作 - InfoQ-CN","url":"https://www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","source":"InfoQ-CN","author":null,"published_at":"2026-09-17T08:00:36+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。\n其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。\n相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力，让 AI 不仅能够“听”和“说”，也能够理解声音背后的语义与情绪，并参与更完整的交互和内容生产过程。\n其中，面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话，可以在持续交流过程中判断何时回应、何时等待，并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中，该模型以 98.9%的综合得分排名全球第一。\n与传统实时语音模型主要追求低延迟和自然对话不同，StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音，并支持推理与语音生成并行；Tool Call 和长任务则可以异步执行，在任务运行期间不打断当前对话。\n其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。\n在语音识别方面，StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合，不仅要解决“听清楚”，也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。\n该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景，并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中，StepAudio 3 ASR 的 WER（词错误率）为 1.7%，并列全球第一。\n除实时交互和语音识别外，此次发布也进一步拓展了语音生成模型的能力边界。\nStepAudio 3 TTS 面向真人级语音生成，在音色、语调、节奏、停顿和情绪表达之外，还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构，可实现生成与播放同时进行，满足实时语音应用需求。\nStepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情，一次生成包含多种声音元素的完整音频，并控制角色音色、情绪以及不同声音出现的时间与顺序，广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。\n面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”，而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代，使 AI 更深入参与实际音乐生产流程。\n过去一年，语音大模型正从单项的语音识别和生成能力，逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布，阶跃音频模型的产品版图，已经全面覆盖了听、说、理解、推理和创作。\n目前，StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。","full_text":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。\n其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。\n相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力，让 AI 不仅能够“听”和“说”，也能够理解声音背后的语义与情绪，并参与更完整的交互和内容生产过程。\n其中，面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话，可以在持续交流过程中判断何时回应、何时等待，并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中，该模型以 98.9%的综合得分排名全球第一。\n与传统实时语音模型主要追求低延迟和自然对话不同，StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音，并支持推理与语音生成并行；Tool Call 和长任务则可以异步执行，在任务运行期间不打断当前对话。\n其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。\n在语音识别方面，StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合，不仅要解决“听清楚”，也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。\n该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景，并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中，StepAudio 3 ASR 的 WER（词错误率）为 1.7%，并列全球第一。\n除实时交互和语音识别外，此次发布也进一步拓展了语音生成模型的能力边界。\nStepAudio 3 TTS 面向真人级语音生成，在音色、语调、节奏、停顿和情绪表达之外，还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构，可实现生成与播放同时进行，满足实时语音应用需求。\nStepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情，一次生成包含多种声音元素的完整音频，并控制角色音色、情绪以及不同声音出现的时间与顺序，广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。\n面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”，而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代，使 AI 更深入参与实际音乐生产流程。\n过去一年，语音大模型正从单项的语音识别和生成能力，逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布，阶跃音频模型的产品版图，已经全面覆盖了听、说、理解、推理和创作。\n目前，StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 1502 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1502 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1502,"summary_length":1502,"usable_text_length":1502,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1502,"summary_length":1502}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1502 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1502,"summary_length":1502,"usable_text_length":1502,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1502,"summary_length":1502}},"actions":{"read":"/item/84397","export_markdown":"/api/items/84397/export?format=markdown","export_json":"/api/items/84397/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC"}},"digest":{"id":84397,"title":"阶跃发布全新语音大模型 StepAudio 3 系列：覆盖语音识别、生成、实时交互与音乐创作 - InfoQ-CN","url":"https://www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","source":"InfoQ-CN","topic":"ai","published_at":"2026-09-17T08:00:36+00:00","excerpt":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。 其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。 相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 1502 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"阶跃发布全新语音大模型 StepAudio 3 系列：覆盖语音识别、生成、实时交互与音乐创作 - InfoQ-CN","subtitle":"InfoQ-CN · 2026-09-17","summary":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。 其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis…","badges":["quality:high"],"links":{"read":"/item/84397","original":"https://www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC"},"quality_warning":null},"export":{"title":"阶跃发布全新语音大模型 StepAudio 3 系列：覆盖语音识别、生成、实时交互与音乐创作 - InfoQ-CN","url":"https://www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","summary":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。\n其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。\n相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力，让 AI 不仅能够“听”和“说”，也能够理解声音背后的语义与情绪，并参与更完整的交互和内容生产过程。\n其中，面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话，可以在持续交流过程中判断何时回应、何时等待，并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中，该模型以 98.9%的综合得分排名全球第一。\n与传统实时语音模型主要追求低延迟和自然对话不同，StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音，并支持推理与语音生成并行；Tool Call 和长任务则可以异步执行，在任务运行期间不打断当前对话。\n其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。\n在语音识别方面，StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合，不仅要解决“听清楚”，也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。\n该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景，并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中，StepAudio 3 ASR 的 WER（词错误率）为 1.7%，并列全球第一。\n除实时交互和语音识别外，此次发布也进一步拓展了语音生成模型的能力边界。\nStepAudio 3 TTS 面向真人级语音生成，在音色、语调、节奏、停顿和情绪表达之外，还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构，可实现生成与播放同时进行，满足实时语音应用需求。\nStepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情，一次生成包含多种声音元素的完整音频，并控制角色音色、情绪以及不同声音出现的时间与顺序，广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。\n面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”，而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代，使 AI 更深入参与实际音乐生产流程。\n过去一年，语音大模型正从单项的语音识别和生成能力，逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布，阶跃音频模型的产品版图，已经全面覆盖了听、说、理解、推理和创作。\n目前，StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。","source":"InfoQ-CN","date":"2026-09-17T08:00:36+00:00","content":"9 月 15 日，阶跃发布新一代语音大模型 StepAudio 3 系列，一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型，覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。\n其中，多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。\n相比过去主要围绕语音识别或语音生成等单项能力展开竞争，StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力，让 AI 不仅能够“听”和“说”，也能够理解声音背后的语义与情绪，并参与更完整的交互和内容生产过程。\n其中，面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话，可以在持续交流过程中判断何时回应、何时等待，并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中，该模型以 98.9%的综合得分排名全球第一。\n与传统实时语音模型主要追求低延迟和自然对话不同，StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音，并支持推理与语音生成并行；Tool Call 和长任务则可以异步执行，在任务运行期间不打断当前对话。\n其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。\n在语音识别方面，StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合，不仅要解决“听清楚”，也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。\n该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景，并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中，StepAudio 3 ASR 的 WER（词错误率）为 1.7%，并列全球第一。\n除实时交互和语音识别外，此次发布也进一步拓展了语音生成模型的能力边界。\nStepAudio 3 TTS 面向真人级语音生成，在音色、语调、节奏、停顿和情绪表达之外，还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构，可实现生成与播放同时进行，满足实时语音应用需求。\nStepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情，一次生成包含多种声音元素的完整音频，并控制角色音色、情绪以及不同声音出现的时间与顺序，广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。\n面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”，而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代，使 AI 更深入参与实际音乐生产流程。\n过去一年，语音大模型正从单项的语音识别和生成能力，逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布，阶跃音频模型的产品版图，已经全面覆盖了听、说、理解、推理和创作。\n目前，StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 1502 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 1502 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":1502,"summary_length":1502,"usable_text_length":1502,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":1502,"summary_length":1502}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}