{"id":82704,"topic":"ai","source":"凤凰网科技","title":"阶跃发布StepAudio 3系列语音大模型，多款模型登顶全球第一 - 凤凰网科技","url":"https://tech.ifeng.com/c/8wRQ1Eakx0h","url_hash":"1dc66e1397e2bafff7db25e44d4c17d5ce9cd21e","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiTEFVX3lxTE5FTGluNUpGaVhKUGRWclpIbTFDMWI4LW04TEl0NWJfX3h4dHZYalNkYmtoUVhWdWs2ZTRHdGE3Y21MNWlDSW52TnM3SVc?oc=5\" target=\"_blank\">阶跃发布StepAudio 3系列语音大模型，多款模型登顶全球第一</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">凤凰网科技</font>","content":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。\nStepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音，支持推理与语音生成并行，Tool Call和长任务可异步执行，不阻塞当前语音会话。\nStepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合，支持中文、英文、方言、中英混说、长音频及专业领域识别，能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%，并列全球第一。\nStepAudio 3 TTS面向实时交互场景，在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式，可还原笑声、迟疑、结巴、重复、改口等副语言表现，并基于流式生成架构实现生成与播放同步。\nStepAudio 3 Gen支持基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐，可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制，并支持对白、音效、环境声和背景音乐的时间与顺序编排。\nStepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作，覆盖歌曲创作、清唱配乐、歌曲翻唱等功能，用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模，在清唱配乐场景中可理解旋律、节奏和情绪，并补充和声、乐器及完整编曲。","image_url":"https://x0.ifengimg.com/ucms/2026_38/8D32E8C3575A7963EE1A1ED9935BE6D6CD6B0CA1_size635_w975_h549.png","lang":"zh","published_at":"2026-09-15T07:56:53+00:00","fetched_at":"2026-09-15T08:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。\nStepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音，支持推理与语音生成并行，Tool Call和长任务可异步执行，不阻塞当前语音会话。\nStepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合，支持中文、英文、方言、中英混说、长音频及专业领域识别，能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%，并列全球第一。\nStepAudio 3 TTS面向实时交互场景，在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式，可还原笑声、迟疑、结巴、重复、改口等副语言表现，并基于流式生成架构实现生成与播放同步。\nStepAudio 3 Gen支持基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐，可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制，并支持对白、音效、环境声和背景音乐的时间与顺序编排。\nStepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作，覆盖歌曲创作、清唱配乐、歌曲翻唱等功能，用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模，在清唱配乐场景中可理解旋律、节奏和情绪，并补充和声、乐器及完整编曲。","cluster_id":3497165,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://tech.ifeng.com/c/8wRQ1Eakx0h","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 933 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":933,"summary_length":933,"usable_text_length":933,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":933,"summary_length":933}},"news_item":{"id":82704,"canonical_url":"https://tech.ifeng.com/c/8wRQ1Eakx0h","source_url":"https://tech.ifeng.com/c/8wRQ1Eakx0h","title":"阶跃发布StepAudio 3系列语音大模型，多款模型登顶全球第一 - 凤凰网科技","source_name":"凤凰网科技","author":null,"published_at":"2026-09-15T07:56:53+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiTEFVX3lxTE5FTGluNUpGaVhKUGRWclpIbTFDMWI4LW04TEl0NWJfX3h4dHZYalNkYmtoUVhWdWs2ZTRHdGE3Y21MNWlDSW52TnM3SVc?oc=5\" target=\"_blank\">阶跃发布StepAudio 3系列语音大模型，多款模型登顶全球第一</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">凤凰网科技</font>","full_text":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。\nStepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音，支持推理与语音生成并行，Tool Call和长任务可异步执行，不阻塞当前语音会话。\nStepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合，支持中文、英文、方言、中英混说、长音频及专业领域识别，能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%，并列全球第一。\nStepAudio 3 TTS面向实时交互场景，在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式，可还原笑声、迟疑、结巴、重复、改口等副语言表现，并基于流式生成架构实现生成与播放同步。\nStepAudio 3 Gen支持基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐，可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制，并支持对白、音效、环境声和背景音乐的时间与顺序编排。\nStepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作，覆盖歌曲创作、清唱配乐、歌曲翻唱等功能，用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模，在清唱配乐场景中可理解旋律、节奏和情绪，并补充和声、乐器及完整编曲。","excerpt":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。\nStepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音，支持推理与语音生成并行，Tool Call和长任务可异步执行，不阻塞当前语音会话。\nStepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合，支持中文、英文、方言、中英混说、长音频及专业领域识别，能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%，并列全球第一。\nStepAudio 3 TTS面向实时交互场景，在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式，可还原笑声、迟疑、结巴、重复、改口等副语言表现，并基于流式生成架构实现生成与播放同步。\nStepAudio 3 Gen支持基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐，可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制，并支持对白、音效、环境声和背景音乐的时间与顺序编排。\nStepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作，覆盖歌曲创作、清唱配乐、歌曲翻唱等功能，用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模，在清唱配乐场景中可理解旋律、节奏和情绪，并补充和声、乐器及完整编曲。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 933 characters.","diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQ1Eakx0h","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 933 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":933,"summary_length":933,"usable_text_length":933,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":933,"summary_length":933}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"阶跃发布StepAudio 3系列语音大模型，多款模型登顶全球第一 - 凤凰网科技","url":"https://tech.ifeng.com/c/8wRQ1Eakx0h","summary":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。\nStepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音，支持推理与语音生成并行，Tool Call和长任务可异步执行，不阻塞当前语音会话。\nStepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合，支持中文、英文、方言、中英混说、长音频及专业领域识别，能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%，并列全球第一。\nStepAudio 3 TTS面向实时交互场景，在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式，可还原笑声、迟疑、结巴、重复、改口等副语言表现，并基于流式生成架构实现生成与播放同步。\nStepAudio 3 Gen支持基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐，可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制，并支持对白、音效、环境声和背景音乐的时间与顺序编排。\nStepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作，覆盖歌曲创作、清唱配乐、歌曲翻唱等功能，用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模，在清唱配乐场景中可理解旋律、节奏和情绪，并补充和声、乐器及完整编曲。","source":"凤凰网科技","date":"2026-09-15T07:56:53+00:00","content":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。\nStepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音，支持推理与语音生成并行，Tool Call和长任务可异步执行，不阻塞当前语音会话。\nStepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合，支持中文、英文、方言、中英混说、长音频及专业领域识别，能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%，并列全球第一。\nStepAudio 3 TTS面向实时交互场景，在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式，可还原笑声、迟疑、结巴、重复、改口等副语言表现，并基于流式生成架构实现生成与播放同步。\nStepAudio 3 Gen支持基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐，可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制，并支持对白、音效、环境声和背景音乐的时间与顺序编排。\nStepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作，覆盖歌曲创作、清唱配乐、歌曲翻唱等功能，用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模，在清唱配乐场景中可理解旋律、节奏和情绪，并补充和声、乐器及完整编曲。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQ1Eakx0h","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 933 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 933 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":933,"summary_length":933,"usable_text_length":933,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":933,"summary_length":933}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/82704","export_markdown":"/api/items/82704/export?format=markdown","export_json":"/api/items/82704/export?format=json","diagnose":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQ1Eakx0h"},"formats":{"full":{"id":82704,"title":"阶跃发布StepAudio 3系列语音大模型，多款模型登顶全球第一 - 凤凰网科技","url":"https://tech.ifeng.com/c/8wRQ1Eakx0h","source":"凤凰网科技","author":null,"published_at":"2026-09-15T07:56:53+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。\nStepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音，支持推理与语音生成并行，Tool Call和长任务可异步执行，不阻塞当前语音会话。\nStepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合，支持中文、英文、方言、中英混说、长音频及专业领域识别，能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%，并列全球第一。\nStepAudio 3 TTS面向实时交互场景，在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式，可还原笑声、迟疑、结巴、重复、改口等副语言表现，并基于流式生成架构实现生成与播放同步。\nStepAudio 3 Gen支持基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐，可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制，并支持对白、音效、环境声和背景音乐的时间与顺序编排。\nStepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作，覆盖歌曲创作、清唱配乐、歌曲翻唱等功能，用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模，在清唱配乐场景中可理解旋律、节奏和情绪，并补充和声、乐器及完整编曲。","full_text":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。\nStepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音，支持推理与语音生成并行，Tool Call和长任务可异步执行，不阻塞当前语音会话。\nStepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合，支持中文、英文、方言、中英混说、长音频及专业领域识别，能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%，并列全球第一。\nStepAudio 3 TTS面向实时交互场景，在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式，可还原笑声、迟疑、结巴、重复、改口等副语言表现，并基于流式生成架构实现生成与播放同步。\nStepAudio 3 Gen支持基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐，可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制，并支持对白、音效、环境声和背景音乐的时间与顺序编排。\nStepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作，覆盖歌曲创作、清唱配乐、歌曲翻唱等功能，用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模，在清唱配乐场景中可理解旋律、节奏和情绪，并补充和声、乐器及完整编曲。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 933 characters.","diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQ1Eakx0h","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 933 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":933,"summary_length":933,"usable_text_length":933,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":933,"summary_length":933}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 933 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":933,"summary_length":933,"usable_text_length":933,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":933,"summary_length":933}},"actions":{"read":"/item/82704","export_markdown":"/api/items/82704/export?format=markdown","export_json":"/api/items/82704/export?format=json","diagnose":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQ1Eakx0h"}},"digest":{"id":82704,"title":"阶跃发布StepAudio 3系列语音大模型，多款模型登顶全球第一 - 凤凰网科技","url":"https://tech.ifeng.com/c/8wRQ1Eakx0h","source":"凤凰网科技","topic":"ai","published_at":"2026-09-15T07:56:53+00:00","excerpt":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。 StepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 933 characters.","reading_time_min":1,"cluster_id":3497165},"card":{"display_title":"阶跃发布StepAudio 3系列语音大模型，多款模型登顶全球第一 - 凤凰网科技","subtitle":"凤凰网科技 · 2026-09-15","summary":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。 StepAudio 3 Realtime支持原生全双工实时对话，在Artificial…","badges":["quality:high"],"links":{"read":"/item/82704","original":"https://tech.ifeng.com/c/8wRQ1Eakx0h","diagnose":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQ1Eakx0h"},"quality_warning":null},"export":{"title":"阶跃发布StepAudio 3系列语音大模型，多款模型登顶全球第一 - 凤凰网科技","url":"https://tech.ifeng.com/c/8wRQ1Eakx0h","summary":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。\nStepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音，支持推理与语音生成并行，Tool Call和长任务可异步执行，不阻塞当前语音会话。\nStepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合，支持中文、英文、方言、中英混说、长音频及专业领域识别，能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%，并列全球第一。\nStepAudio 3 TTS面向实时交互场景，在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式，可还原笑声、迟疑、结巴、重复、改口等副语言表现，并基于流式生成架构实现生成与播放同步。\nStepAudio 3 Gen支持基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐，可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制，并支持对白、音效、环境声和背景音乐的时间与顺序编排。\nStepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作，覆盖歌曲创作、清唱配乐、歌曲翻唱等功能，用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模，在清唱配乐场景中可理解旋律、节奏和情绪，并补充和声、乐器及完整编曲。","source":"凤凰网科技","date":"2026-09-15T07:56:53+00:00","content":"凤凰网科技讯 9月15日，阶跃星辰今日正式发布StepAudio 3系列语音大模型，包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。\nStepAudio 3 Realtime支持原生全双工实时对话，在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一，在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音，支持推理与语音生成并行，Tool Call和长任务可异步执行，不阻塞当前语音会话。\nStepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合，支持中文、英文、方言、中英混说、长音频及专业领域识别，能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入，在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%，并列全球第一。\nStepAudio 3 TTS面向实时交互场景，在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式，可还原笑声、迟疑、结巴、重复、改口等副语言表现，并基于流式生成架构实现生成与播放同步。\nStepAudio 3 Gen支持基于自然语言描述和参考音频，统一生成人声、音效、环境音和背景音乐，可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制，并支持对白、音效、环境声和背景音乐的时间与顺序编排。\nStepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作，覆盖歌曲创作、清唱配乐、歌曲翻唱等功能，用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模，在清唱配乐场景中可理解旋律、节奏和情绪，并补充和声、乐器及完整编曲。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wRQ1Eakx0h","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 933 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 933 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":933,"summary_length":933,"usable_text_length":933,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":933,"summary_length":933}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}