{"id":82748,"topic":"ai","source":"凤凰网科技","title":"阶跃发布StepAudio 3系列语音大模型，拿下多个全球第一 - 凤凰网科技","url":"https://tech.ifeng.com/c/8wRQDJ8y964","url_hash":"cdd52a4b7f77be0005a79ed9fa9b76aa2886f092","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiTEFVX3lxTE9vZXRDaUxfZ2ZvSFNRckFUaHNRMUNLY0pVNXkwWjYwZ2RQbGlyRElJSVBiblg4MHhtOXlBdzdObFo0OElIa25MR2J0WHk?oc=5\" target=\"_blank\">阶跃发布StepAudio 3系列语音大模型，拿下多个全球第一</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">凤凰网科技</font>","content":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。\n官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。\nIT之家附模型官方详细介绍如下：\nStepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动\n今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。\nStepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。\n在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。\n与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。\n模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。\n面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。\n不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。\n这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。\nStepAudio 3 ASR：从听清，到听懂\n传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。\nStepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。\n它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。\n模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。\n这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。\nStepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。\nStepAudio 3 TTS：不止朗读，更像真人表达\n声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。\nStepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。\n模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。\n同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。\nStepAudio 3 Gen：人声、音效、环境、音乐，一次生成\n传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。\nStepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。\n它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。\n更重要的是，这些声音并不是简单叠加。\nStepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。\n这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。\n对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。\nStepAudio 3 Music：不止生成，更参与创作\n音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。\nStepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。\n模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。\n与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。\n模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。\n尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。\n一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。\n这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","image_url":"https://x0.ifengimg.com/res/2026/7272D98CF089B09C16D3B495577818C2FEBAB9E2_size23_w720_h380.webp","lang":"zh","published_at":"2026-09-15T07:55:52+00:00","fetched_at":"2026-09-15T09:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。\n官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。\nIT之家附模型官方详细介绍如下：\nStepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动\n今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。\nStepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。\n在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。\n与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。\n模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。\n面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。\n不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。\n这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。\nStepAudio 3 ASR：从听清，到听懂\n传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。\nStepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。\n它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。\n模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。\n这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。\nStepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。\nStepAudio 3 TTS：不止朗读，更像真人表达\n声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。\nStepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。\n模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。\n同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。\nStepAudio 3 Gen：人声、音效、环境、音乐，一次生成\n传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。\nStepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。\n它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。\n更重要的是，这些声音并不是简单叠加。\nStepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。\n这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。\n对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。\nStepAudio 3 Music：不止生成，更参与创作\n音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。\nStepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。\n模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。\n与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。\n模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。\n尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。\n一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。\n这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","cluster_id":3494603,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://tech.ifeng.com/c/8wRQDJ8y964","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3263 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3263,"summary_length":3263,"usable_text_length":3263,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3263,"summary_length":3263}},"news_item":{"id":82748,"canonical_url":"https://tech.ifeng.com/c/8wRQDJ8y964","source_url":"https://tech.ifeng.com/c/8wRQDJ8y964","title":"阶跃发布StepAudio 3系列语音大模型，拿下多个全球第一 - 凤凰网科技","source_name":"凤凰网科技","author":null,"published_at":"2026-09-15T07:55:52+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiTEFVX3lxTE9vZXRDaUxfZ2ZvSFNRckFUaHNRMUNLY0pVNXkwWjYwZ2RQbGlyRElJSVBiblg4MHhtOXlBdzdObFo0OElIa25MR2J0WHk?oc=5\" target=\"_blank\">阶跃发布StepAudio 3系列语音大模型，拿下多个全球第一</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">凤凰网科技</font>","full_text":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。\n官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。\nIT之家附模型官方详细介绍如下：\nStepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动\n今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。\nStepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。\n在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。\n与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。\n模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。\n面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。\n不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。\n这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。\nStepAudio 3 ASR：从听清，到听懂\n传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。\nStepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。\n它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。\n模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。\n这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。\nStepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。\nStepAudio 3 TTS：不止朗读，更像真人表达\n声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。\nStepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。\n模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。\n同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。\nStepAudio 3 Gen：人声、音效、环境、音乐，一次生成\n传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。\nStepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。\n它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。\n更重要的是，这些声音并不是简单叠加。\nStepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。\n这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。\n对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。\nStepAudio 3 Music：不止生成，更参与创作\n音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。\nStepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。\n模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。\n与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。\n模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。\n尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。\n一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。\n这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","excerpt":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。\n官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。\nIT之家附模型官方详细介绍如下：\nStepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动\n今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。\nStepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。\n在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。\n与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。\n模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。\n面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。\n不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。\n这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。\nStepAudio 3 ASR：从听清，到听懂\n传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。\nStepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。\n它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。\n模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。\n这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。\nStepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。\nStepAudio 3 TTS：不止朗读，更像真人表达\n声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。\nStepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。\n模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。\n同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。\nStepAudio 3 Gen：人声、音效、环境、音乐，一次生成\n传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。\nStepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。\n它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。\n更重要的是，这些声音并不是简单叠加。\nStepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。\n这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。\n对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。\nStepAudio 3 Music：不止生成，更参与创作\n音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。\nStepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。\n模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。\n与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。\n模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。\n尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。\n一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。\n这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3263 characters.","diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQDJ8y964","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3263 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3263,"summary_length":3263,"usable_text_length":3263,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3263,"summary_length":3263}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"阶跃发布StepAudio 3系列语音大模型，拿下多个全球第一 - 凤凰网科技","url":"https://tech.ifeng.com/c/8wRQDJ8y964","summary":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。\n官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。\nIT之家附模型官方详细介绍如下：\nStepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动\n今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。\nStepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。\n在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。\n与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。\n模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。\n面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。\n不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。\n这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。\nStepAudio 3 ASR：从听清，到听懂\n传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。\nStepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。\n它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。\n模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。\n这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。\nStepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。\nStepAudio 3 TTS：不止朗读，更像真人表达\n声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。\nStepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。\n模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。\n同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。\nStepAudio 3 Gen：人声、音效、环境、音乐，一次生成\n传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。\nStepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。\n它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。\n更重要的是，这些声音并不是简单叠加。\nStepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。\n这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。\n对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。\nStepAudio 3 Music：不止生成，更参与创作\n音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。\nStepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。\n模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。\n与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。\n模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。\n尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。\n一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。\n这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","source":"凤凰网科技","date":"2026-09-15T07:55:52+00:00","content":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。\n官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。\nIT之家附模型官方详细介绍如下：\nStepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动\n今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。\nStepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。\n在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。\n与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。\n模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。\n面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。\n不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。\n这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。\nStepAudio 3 ASR：从听清，到听懂\n传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。\nStepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。\n它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。\n模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。\n这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。\nStepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。\nStepAudio 3 TTS：不止朗读，更像真人表达\n声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。\nStepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。\n模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。\n同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。\nStepAudio 3 Gen：人声、音效、环境、音乐，一次生成\n传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。\nStepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。\n它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。\n更重要的是，这些声音并不是简单叠加。\nStepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。\n这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。\n对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。\nStepAudio 3 Music：不止生成，更参与创作\n音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。\nStepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。\n模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。\n与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。\n模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。\n尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。\n一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。\n这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQDJ8y964","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3263 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3263 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3263,"summary_length":3263,"usable_text_length":3263,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3263,"summary_length":3263}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/82748","export_markdown":"/api/items/82748/export?format=markdown","export_json":"/api/items/82748/export?format=json","diagnose":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQDJ8y964"},"formats":{"full":{"id":82748,"title":"阶跃发布StepAudio 3系列语音大模型，拿下多个全球第一 - 凤凰网科技","url":"https://tech.ifeng.com/c/8wRQDJ8y964","source":"凤凰网科技","author":null,"published_at":"2026-09-15T07:55:52+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。\n官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。\nIT之家附模型官方详细介绍如下：\nStepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动\n今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。\nStepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。\n在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。\n与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。\n模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。\n面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。\n不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。\n这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。\nStepAudio 3 ASR：从听清，到听懂\n传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。\nStepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。\n它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。\n模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。\n这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。\nStepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。\nStepAudio 3 TTS：不止朗读，更像真人表达\n声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。\nStepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。\n模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。\n同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。\nStepAudio 3 Gen：人声、音效、环境、音乐，一次生成\n传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。\nStepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。\n它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。\n更重要的是，这些声音并不是简单叠加。\nStepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。\n这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。\n对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。\nStepAudio 3 Music：不止生成，更参与创作\n音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。\nStepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。\n模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。\n与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。\n模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。\n尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。\n一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。\n这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","full_text":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。\n官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。\nIT之家附模型官方详细介绍如下：\nStepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动\n今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。\nStepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。\n在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。\n与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。\n模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。\n面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。\n不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。\n这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。\nStepAudio 3 ASR：从听清，到听懂\n传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。\nStepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。\n它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。\n模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。\n这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。\nStepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。\nStepAudio 3 TTS：不止朗读，更像真人表达\n声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。\nStepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。\n模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。\n同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。\nStepAudio 3 Gen：人声、音效、环境、音乐，一次生成\n传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。\nStepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。\n它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。\n更重要的是，这些声音并不是简单叠加。\nStepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。\n这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。\n对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。\nStepAudio 3 Music：不止生成，更参与创作\n音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。\nStepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。\n模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。\n与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。\n模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。\n尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。\n一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。\n这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3263 characters.","diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQDJ8y964","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3263 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3263,"summary_length":3263,"usable_text_length":3263,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3263,"summary_length":3263}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3263 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3263,"summary_length":3263,"usable_text_length":3263,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3263,"summary_length":3263}},"actions":{"read":"/item/82748","export_markdown":"/api/items/82748/export?format=markdown","export_json":"/api/items/82748/export?format=json","diagnose":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQDJ8y964"}},"digest":{"id":82748,"title":"阶跃发布StepAudio 3系列语音大模型，拿下多个全球第一 - 凤凰网科技","url":"https://tech.ifeng.com/c/8wRQDJ8y964","source":"凤凰网科技","topic":"ai","published_at":"2026-09-15T07:55:52+00:00","excerpt":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。 官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。 IT之家附模型官方详细介绍如下： StepAudio…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 3263 characters.","reading_time_min":1,"cluster_id":3494603},"card":{"display_title":"阶跃发布StepAudio 3系列语音大模型，拿下多个全球第一 - 凤凰网科技","subtitle":"凤凰网科技 · 2026-09-15","summary":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。 官方称，StepAudio 3…","badges":["quality:high"],"links":{"read":"/item/82748","original":"https://tech.ifeng.com/c/8wRQDJ8y964","diagnose":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQDJ8y964"},"quality_warning":null},"export":{"title":"阶跃发布StepAudio 3系列语音大模型，拿下多个全球第一 - 凤凰网科技","url":"https://tech.ifeng.com/c/8wRQDJ8y964","summary":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。\n官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。\nIT之家附模型官方详细介绍如下：\nStepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动\n今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。\nStepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。\n在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。\n与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。\n模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。\n面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。\n不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。\n这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。\nStepAudio 3 ASR：从听清，到听懂\n传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。\nStepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。\n它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。\n模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。\n这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。\nStepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。\nStepAudio 3 TTS：不止朗读，更像真人表达\n声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。\nStepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。\n模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。\n同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。\nStepAudio 3 Gen：人声、音效、环境、音乐，一次生成\n传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。\nStepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。\n它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。\n更重要的是，这些声音并不是简单叠加。\nStepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。\n这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。\n对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。\nStepAudio 3 Music：不止生成，更参与创作\n音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。\nStepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。\n模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。\n与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。\n模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。\n尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。\n一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。\n这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","source":"凤凰网科技","date":"2026-09-15T07:55:52+00:00","content":"IT之家 9 月 15 日消息，今日阶跃正式发布 StepAudio3 系列模型，包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music，其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型，目前均已上线阶跃星辰开放平台。\n官方称，StepAudio 3 系列分别面向几类核心场景：真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。\nIT之家附模型官方详细介绍如下：\nStepAudio 3 Realtime：不仅“能打断”，更能理解、思考和行动\n今天，越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的，不只是“能不能同时听和说”，而是模型能否在一场持续发生的对话中，边听边理解、判断何时接话，同时完成推理和任务执行。\nStepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力，支持原生全双工实时对话。\n在 Artificial Analysis Conversational Dynamics 榜单中，StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一，展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”，更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待，以及如何处理用户的临时打断和连续反馈。\n与此同时，StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力，是业内评估“原生语音模型”最权威的第三方基准之一。\n模型还可以同时理解语义、语气、情绪、副语言和环境声音，让实时交互不只依赖文字内容，而是利用更完整的音频信息理解用户意图。\n面对复杂问题，StepAudio 3 Realtime 支持推理与语音生成并行，在快速回应的同时继续组织和深化后续答案。\n不仅如此，Tool Call 和长任务可以异步执行，不阻塞当前语音会话。任务运行期间，用户仍然可以继续交流，结果完成后再自然回到当前上下文。\n这让 Realtime 语音模型不只是“更自然地聊天”，而是能够在同一场持续对话中完成听、说、想、做。\nStepAudio 3 ASR：从听清，到听懂\n传统语音识别主要解决“听到了什么”，但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型，不仅需要准确转写声音，也需要理解说话者表达的含义。\nStepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合，让语音识别从“辨认声音”进一步走向“理解语境”。\n它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别，能够适应不同语言环境和表达方式。同时，依托大语言模型带来的知识理解能力，StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容，在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。\n模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，让真实声音环境下的语音被更准确地识别和使用。\n这意味着，ASR 模型不再只是个声音转写工具，而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景，都能精准地完成任务。\nStepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中，WER（词错误率) 仅为 1.7%，并列全球第一。\nStepAudio 3 TTS：不止朗读，更像真人表达\n声音不仅承载文字信息，也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流，一直是语音生成模型的重要方向。\nStepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型，致力于让 AI 语音从“准确发声”走向“自然表达”。\n模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式，不仅能够生成文字对应的语音，还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现，让合成语音更接近真人说话。\n同时，StepAudio 3 TTS 能够结合语义内容理解表达意图，自主调整情绪与语气变化，使声音表达更加符合具体场景。在实时交互方面，模型基于流式生成架构，实现生成与播放同步进行，可满足实时语音应用需求。\nStepAudio 3 Gen：人声、音效、环境、音乐，一次生成\n传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作，再经过剪辑、对齐和混音，才能形成最终作品。\nStepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。\n它可以基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情，无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。\n更重要的是，这些声音并不是简单叠加。\nStepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音，以及笑声、喘息、停顿等副语言特征进行精细控制，也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。\n这意味着，模型不仅在“生成声音”，也开始参与整段内容的声音设计和时序编排。\n对于影视、动画、游戏、广播剧、有声书和短视频创作者而言，原本需要素材搜集、多工具协作和大量后期处理的声音制作流程，有机会被压缩到一次生成和持续迭代中。\nStepAudio 3 Music：不止生成，更参与创作\n音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作，并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo，希望 AI 接着往下完成编曲、改编和制作。\nStepAudio 3 Music 因此不仅支持从零生成，也支持基于 ABC 记谱法控制的多轮交互创作。\n模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入，让模型围绕已有创作继续生成和完善作品。\n与此同时，用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。\n模型还对主歌、副歌、桥段、间奏等歌曲结构，以及跨段落的旋律发展、能量变化和演唱表达进行建模，让生成目标不只是“一段好听的音乐”，而是一首结构完整、表达连贯的作品。\n尤其在清唱配乐场景中，用户只需要提供一段清唱，模型就可以理解其中的旋律、节奏和情绪，并进一步补充和声、节奏、乐器和完整编曲。\n一首温暖柔和的 City Pop 男声歌曲，带一点爵士和轻摇滚的感觉，氛围朦胧浪漫。\n这让音乐大模型开始更深入地进入真实音乐生产流程，而不仅仅是一个“一键生成歌曲”的工具。\n“特别声明：以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布，本平台仅提供信息存储空间服务。\nNotice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQDJ8y964","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3263 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3263 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3263,"summary_length":3263,"usable_text_length":3263,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3263,"summary_length":3263}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}