{"id":88632,"topic":"ai","source":"凤凰网科技","title":"阿里千问发布Qwen-Audio-3.1系列语音大模型，全线降价最高达95% - 凤凰网科技","url":"https://tech.ifeng.com/c/8wbYxCAilw7","url_hash":"311be3c06768245329d65a544b9bb96720c2ee7d","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiTEFVX3lxTE9nb1lERWV0OEdJOGJlNEJYUmpHanZVaEZ0aHQtcUxNT29qSlJVZTZoY0VSdGFQTWZOWHpMcjdzN0NadWF2amFQVFNGRzI?oc=5\" target=\"_blank\">阿里千问发布Qwen-Audio-3.1系列语音大模型，全线降价最高达95%</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">凤凰网科技</font>","content":"凤凰网科技讯 9月23日，千问今日正式发布Qwen-Audio-3.1系列语音大模型，对语音识别、语音合成和实时语音交互三大核心模型进行全面升级，同时推出全新的音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next。官方称，五款新模型形成覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低使用成本，Qwen-Audio全线语音模型价格均下调，其中TTS降价约70%，Realtime降幅约85%，ASR降幅达95%。\nQwen-Audio-3.1-ASR进一步增强多语种、方言识别与上下文理解能力，新增原生转写润色功能，可自动去除语气词与重复表达并重组语义。该模型一套支持30种语言和16种中文方言，支持低延迟流式识别，首字响应约160毫秒。在中文方言内部测试集上，其平均CER为10.38%，在11个方言子集上取得最优结果，温州话等较难方言提升尤为明显。\nQwen-Audio-3.1-ASR-Next基于下代架构，能够理解人物情绪、环境声与机械声，完成声音描述、事件定位、音频问答与推理。ASR处理的对象从“语音中的文字”扩展为“完整的音频信息”。在分角色ASR评测中，该模型在四个测试集的八项指标中取得五项最优结果。\nQwen-Audio-3.1-TTS支持多语种及方言合成，并支持同一音色跨语言合成时的自然迁移，同时可通过指令控制情绪、语速和表达方式。\nQwen-Audio-3.1-TTS-Next是全新的音频创作模型，不再局限于单一语音合成，而是围绕文本、时间戳和参考音频等输入，统一生成人声、音效和环境音。该模型支持多角色音色复刻与多轮对话生成，融合人声、音效与环境声，并可通过自然语言控制生成过程，支持细粒度时间戳控制和48kHz输出，覆盖播客、有声书、影视剧、游戏、广告等专业音频创作需求。\nQwen-Audio-3.1-Realtime升级全双工实时交互能力，可同时说和听，支持随时插话、打断。模型能够识别用户情绪与交流意图，在对话中切换语言时保持上下文与语气，并可主动调用Agent工具完成搜索、查询或任务执行。目前，Qwen-Audio-3.1-Realtime正在与Qoder、千问办公等Agent，以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等智能硬件结合。","image_url":"https://x0.ifengimg.com/ucms/2026_39/5AA5F8185434AA672AD1BC11A7D82A1D026ECFD3_size50_w710_h400.jpg","lang":"zh","published_at":"2026-09-23T07:22:51+00:00","fetched_at":"2026-09-23T08:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"凤凰网科技讯…","cluster_id":3511174,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://tech.ifeng.com/c/8wbYxCAilw7","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 989 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":989,"summary_length":7,"usable_text_length":989,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":989,"summary_length":7}},"news_item":{"id":88632,"canonical_url":"https://tech.ifeng.com/c/8wbYxCAilw7","source_url":"https://tech.ifeng.com/c/8wbYxCAilw7","title":"阿里千问发布Qwen-Audio-3.1系列语音大模型，全线降价最高达95% - 凤凰网科技","source_name":"凤凰网科技","author":null,"published_at":"2026-09-23T07:22:51+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiTEFVX3lxTE9nb1lERWV0OEdJOGJlNEJYUmpHanZVaEZ0aHQtcUxNT29qSlJVZTZoY0VSdGFQTWZOWHpMcjdzN0NadWF2amFQVFNGRzI?oc=5\" target=\"_blank\">阿里千问发布Qwen-Audio-3.1系列语音大模型，全线降价最高达95%</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">凤凰网科技</font>","full_text":"凤凰网科技讯 9月23日，千问今日正式发布Qwen-Audio-3.1系列语音大模型，对语音识别、语音合成和实时语音交互三大核心模型进行全面升级，同时推出全新的音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next。官方称，五款新模型形成覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低使用成本，Qwen-Audio全线语音模型价格均下调，其中TTS降价约70%，Realtime降幅约85%，ASR降幅达95%。\nQwen-Audio-3.1-ASR进一步增强多语种、方言识别与上下文理解能力，新增原生转写润色功能，可自动去除语气词与重复表达并重组语义。该模型一套支持30种语言和16种中文方言，支持低延迟流式识别，首字响应约160毫秒。在中文方言内部测试集上，其平均CER为10.38%，在11个方言子集上取得最优结果，温州话等较难方言提升尤为明显。\nQwen-Audio-3.1-ASR-Next基于下代架构，能够理解人物情绪、环境声与机械声，完成声音描述、事件定位、音频问答与推理。ASR处理的对象从“语音中的文字”扩展为“完整的音频信息”。在分角色ASR评测中，该模型在四个测试集的八项指标中取得五项最优结果。\nQwen-Audio-3.1-TTS支持多语种及方言合成，并支持同一音色跨语言合成时的自然迁移，同时可通过指令控制情绪、语速和表达方式。\nQwen-Audio-3.1-TTS-Next是全新的音频创作模型，不再局限于单一语音合成，而是围绕文本、时间戳和参考音频等输入，统一生成人声、音效和环境音。该模型支持多角色音色复刻与多轮对话生成，融合人声、音效与环境声，并可通过自然语言控制生成过程，支持细粒度时间戳控制和48kHz输出，覆盖播客、有声书、影视剧、游戏、广告等专业音频创作需求。\nQwen-Audio-3.1-Realtime升级全双工实时交互能力，可同时说和听，支持随时插话、打断。模型能够识别用户情绪与交流意图，在对话中切换语言时保持上下文与语气，并可主动调用Agent工具完成搜索、查询或任务执行。目前，Qwen-Audio-3.1-Realtime正在与Qoder、千问办公等Agent，以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等智能硬件结合。","excerpt":"凤凰网科技讯…","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 989 characters.","diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wbYxCAilw7","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 989 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":989,"summary_length":7,"usable_text_length":989,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":989,"summary_length":7}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"阿里千问发布Qwen-Audio-3.1系列语音大模型，全线降价最高达95% - 凤凰网科技","url":"https://tech.ifeng.com/c/8wbYxCAilw7","summary":"凤凰网科技讯…","source":"凤凰网科技","date":"2026-09-23T07:22:51+00:00","content":"凤凰网科技讯 9月23日，千问今日正式发布Qwen-Audio-3.1系列语音大模型，对语音识别、语音合成和实时语音交互三大核心模型进行全面升级，同时推出全新的音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next。官方称，五款新模型形成覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低使用成本，Qwen-Audio全线语音模型价格均下调，其中TTS降价约70%，Realtime降幅约85%，ASR降幅达95%。\nQwen-Audio-3.1-ASR进一步增强多语种、方言识别与上下文理解能力，新增原生转写润色功能，可自动去除语气词与重复表达并重组语义。该模型一套支持30种语言和16种中文方言，支持低延迟流式识别，首字响应约160毫秒。在中文方言内部测试集上，其平均CER为10.38%，在11个方言子集上取得最优结果，温州话等较难方言提升尤为明显。\nQwen-Audio-3.1-ASR-Next基于下代架构，能够理解人物情绪、环境声与机械声，完成声音描述、事件定位、音频问答与推理。ASR处理的对象从“语音中的文字”扩展为“完整的音频信息”。在分角色ASR评测中，该模型在四个测试集的八项指标中取得五项最优结果。\nQwen-Audio-3.1-TTS支持多语种及方言合成，并支持同一音色跨语言合成时的自然迁移，同时可通过指令控制情绪、语速和表达方式。\nQwen-Audio-3.1-TTS-Next是全新的音频创作模型，不再局限于单一语音合成，而是围绕文本、时间戳和参考音频等输入，统一生成人声、音效和环境音。该模型支持多角色音色复刻与多轮对话生成，融合人声、音效与环境声，并可通过自然语言控制生成过程，支持细粒度时间戳控制和48kHz输出，覆盖播客、有声书、影视剧、游戏、广告等专业音频创作需求。\nQwen-Audio-3.1-Realtime升级全双工实时交互能力，可同时说和听，支持随时插话、打断。模型能够识别用户情绪与交流意图，在对话中切换语言时保持上下文与语气，并可主动调用Agent工具完成搜索、查询或任务执行。目前，Qwen-Audio-3.1-Realtime正在与Qoder、千问办公等Agent，以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等智能硬件结合。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wbYxCAilw7","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 989 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 989 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":989,"summary_length":7,"usable_text_length":989,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":989,"summary_length":7}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/88632","export_markdown":"/api/items/88632/export?format=markdown","export_json":"/api/items/88632/export?format=json","diagnose":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wbYxCAilw7"},"formats":{"full":{"id":88632,"title":"阿里千问发布Qwen-Audio-3.1系列语音大模型，全线降价最高达95% - 凤凰网科技","url":"https://tech.ifeng.com/c/8wbYxCAilw7","source":"凤凰网科技","author":null,"published_at":"2026-09-23T07:22:51+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"凤凰网科技讯…","full_text":"凤凰网科技讯 9月23日，千问今日正式发布Qwen-Audio-3.1系列语音大模型，对语音识别、语音合成和实时语音交互三大核心模型进行全面升级，同时推出全新的音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next。官方称，五款新模型形成覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低使用成本，Qwen-Audio全线语音模型价格均下调，其中TTS降价约70%，Realtime降幅约85%，ASR降幅达95%。\nQwen-Audio-3.1-ASR进一步增强多语种、方言识别与上下文理解能力，新增原生转写润色功能，可自动去除语气词与重复表达并重组语义。该模型一套支持30种语言和16种中文方言，支持低延迟流式识别，首字响应约160毫秒。在中文方言内部测试集上，其平均CER为10.38%，在11个方言子集上取得最优结果，温州话等较难方言提升尤为明显。\nQwen-Audio-3.1-ASR-Next基于下代架构，能够理解人物情绪、环境声与机械声，完成声音描述、事件定位、音频问答与推理。ASR处理的对象从“语音中的文字”扩展为“完整的音频信息”。在分角色ASR评测中，该模型在四个测试集的八项指标中取得五项最优结果。\nQwen-Audio-3.1-TTS支持多语种及方言合成，并支持同一音色跨语言合成时的自然迁移，同时可通过指令控制情绪、语速和表达方式。\nQwen-Audio-3.1-TTS-Next是全新的音频创作模型，不再局限于单一语音合成，而是围绕文本、时间戳和参考音频等输入，统一生成人声、音效和环境音。该模型支持多角色音色复刻与多轮对话生成，融合人声、音效与环境声，并可通过自然语言控制生成过程，支持细粒度时间戳控制和48kHz输出，覆盖播客、有声书、影视剧、游戏、广告等专业音频创作需求。\nQwen-Audio-3.1-Realtime升级全双工实时交互能力，可同时说和听，支持随时插话、打断。模型能够识别用户情绪与交流意图，在对话中切换语言时保持上下文与语气，并可主动调用Agent工具完成搜索、查询或任务执行。目前，Qwen-Audio-3.1-Realtime正在与Qoder、千问办公等Agent，以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等智能硬件结合。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 989 characters.","diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wbYxCAilw7","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 989 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":989,"summary_length":7,"usable_text_length":989,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":989,"summary_length":7}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 989 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":989,"summary_length":7,"usable_text_length":989,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":989,"summary_length":7}},"actions":{"read":"/item/88632","export_markdown":"/api/items/88632/export?format=markdown","export_json":"/api/items/88632/export?format=json","diagnose":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wbYxCAilw7"}},"digest":{"id":88632,"title":"阿里千问发布Qwen-Audio-3.1系列语音大模型，全线降价最高达95% - 凤凰网科技","url":"https://tech.ifeng.com/c/8wbYxCAilw7","source":"凤凰网科技","topic":"ai","published_at":"2026-09-23T07:22:51+00:00","excerpt":"凤凰网科技讯…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 989 characters.","reading_time_min":1,"cluster_id":3511174},"card":{"display_title":"阿里千问发布Qwen-Audio-3.1系列语音大模型，全线降价最高达95% - 凤凰网科技","subtitle":"凤凰网科技 · 2026-09-23","summary":"凤凰网科技讯…","badges":["quality:high"],"links":{"read":"/item/88632","original":"https://tech.ifeng.com/c/8wbYxCAilw7","diagnose":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wbYxCAilw7"},"quality_warning":null},"export":{"title":"阿里千问发布Qwen-Audio-3.1系列语音大模型，全线降价最高达95% - 凤凰网科技","url":"https://tech.ifeng.com/c/8wbYxCAilw7","summary":"凤凰网科技讯…","source":"凤凰网科技","date":"2026-09-23T07:22:51+00:00","content":"凤凰网科技讯 9月23日，千问今日正式发布Qwen-Audio-3.1系列语音大模型，对语音识别、语音合成和实时语音交互三大核心模型进行全面升级，同时推出全新的音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next。官方称，五款新模型形成覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低使用成本，Qwen-Audio全线语音模型价格均下调，其中TTS降价约70%，Realtime降幅约85%，ASR降幅达95%。\nQwen-Audio-3.1-ASR进一步增强多语种、方言识别与上下文理解能力，新增原生转写润色功能，可自动去除语气词与重复表达并重组语义。该模型一套支持30种语言和16种中文方言，支持低延迟流式识别，首字响应约160毫秒。在中文方言内部测试集上，其平均CER为10.38%，在11个方言子集上取得最优结果，温州话等较难方言提升尤为明显。\nQwen-Audio-3.1-ASR-Next基于下代架构，能够理解人物情绪、环境声与机械声，完成声音描述、事件定位、音频问答与推理。ASR处理的对象从“语音中的文字”扩展为“完整的音频信息”。在分角色ASR评测中，该模型在四个测试集的八项指标中取得五项最优结果。\nQwen-Audio-3.1-TTS支持多语种及方言合成，并支持同一音色跨语言合成时的自然迁移，同时可通过指令控制情绪、语速和表达方式。\nQwen-Audio-3.1-TTS-Next是全新的音频创作模型，不再局限于单一语音合成，而是围绕文本、时间戳和参考音频等输入，统一生成人声、音效和环境音。该模型支持多角色音色复刻与多轮对话生成，融合人声、音效与环境声，并可通过自然语言控制生成过程，支持细粒度时间戳控制和48kHz输出，覆盖播客、有声书、影视剧、游戏、广告等专业音频创作需求。\nQwen-Audio-3.1-Realtime升级全双工实时交互能力，可同时说和听，支持随时插话、打断。模型能够识别用户情绪与交流意图，在对话中切换语言时保持上下文与语气，并可主动调用Agent工具完成搜索、查询或任务执行。目前，Qwen-Audio-3.1-Realtime正在与Qoder、千问办公等Agent，以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等智能硬件结合。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//tech.ifeng.com/c/8wbYxCAilw7","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 989 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 989 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":989,"summary_length":7,"usable_text_length":989,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":989,"summary_length":7}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}