{"id":86175,"topic":"ai","source":"AIBase","title":"千问发布 Qwen3.8-LiveTranslate 同声传译大模型：原文译文同屏出，字均延迟压到 2.3 秒 - AIBase","url":"https://news.aibase.com/zh/news/31181","url_hash":"7b14721144aa2c215db5bc9d7360f4e00df51e21","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiTkFVX3lxTFBxWUFDMnRGUV9jMWFERDcyUHV2UHhfVzFCRlFmSHlMcGUyZzBsVW1zZlFPMVZScXdndE5seUFjdkdpNHBWaGpqMnFoSFRqZw?oc=5\" target=\"_blank\">千问发布 Qwen3.8-LiveTranslate 同声传译大模型：原文译文同屏出，字均延迟压到 2.3 秒</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">AIBase</font>","content":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。\n在已经支持60种语言的基础上，新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离，每句话归到对应的人头上，音色复刻也更稳，不会再出现甲乙不分、声音串味;第二是原文译文同帧同出，双语同屏显示，听的人能边听边对;第三是长上下文消歧，模型会联系前文来读懂当下，人名、术语这类最容易翻错的地方精准度明显提升。\n底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计，靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列，按时序交替排列、端到端产出，让\"听懂\"和\"译出\"在同一个序列里完成;Talker 再拿着译文和源音频，把译文合成为保留原说话人音色的语音——也就是说，翻译出来的声音还是那个讲话人的声音。\n在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上，它在翻译忠实度、流畅度、简洁度以及说话人分离错误率（DER）四个维度上，全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里，它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放，同传这个长期被专业译员把守的高门槛场景，正被大模型一步步推成人人可用的基础设施。","image_url":null,"lang":"zh","published_at":"2026-09-20T01:51:00+00:00","fetched_at":"2026-09-20T03:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。\n在已经支持60种语言的基础上，新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离，每句话归到对应的人头上，音色复刻也更稳，不会再出现甲乙不分、声音串味;第二是原文译文同帧同出，双语同屏显示，听的人能边听边对;第三是长上下文消歧，模型会联系前文来读懂当下，人名、术语这类最容易翻错的地方精准度明显提升。\n底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计，靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列，按时序交替排列、端到端产出，让\"听懂\"和\"译出\"在同一个序列里完成;Talker 再拿着译文和源音频，把译文合成为保留原说话人音色的语音——也就是说，翻译出来的声音还是那个讲话人的声音。\n在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上，它在翻译忠实度、流畅度、简洁度以及说话人分离错误率（DER）四个维度上，全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里，它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放，同传这个长期被专业译员把守的高门槛场景，正被大模型一步步推成人人可用的基础设施。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://news.aibase.com/zh/news/31181","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 735 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":735,"summary_length":735,"usable_text_length":735,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":735,"summary_length":735}},"news_item":{"id":86175,"canonical_url":"https://news.aibase.com/zh/news/31181","source_url":"https://news.aibase.com/zh/news/31181","title":"千问发布 Qwen3.8-LiveTranslate 同声传译大模型：原文译文同屏出，字均延迟压到 2.3 秒 - AIBase","source_name":"AIBase","author":null,"published_at":"2026-09-20T01:51:00+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiTkFVX3lxTFBxWUFDMnRGUV9jMWFERDcyUHV2UHhfVzFCRlFmSHlMcGUyZzBsVW1zZlFPMVZScXdndE5seUFjdkdpNHBWaGpqMnFoSFRqZw?oc=5\" target=\"_blank\">千问发布 Qwen3.8-LiveTranslate 同声传译大模型：原文译文同屏出，字均延迟压到 2.3 秒</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">AIBase</font>","full_text":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。\n在已经支持60种语言的基础上，新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离，每句话归到对应的人头上，音色复刻也更稳，不会再出现甲乙不分、声音串味;第二是原文译文同帧同出，双语同屏显示，听的人能边听边对;第三是长上下文消歧，模型会联系前文来读懂当下，人名、术语这类最容易翻错的地方精准度明显提升。\n底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计，靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列，按时序交替排列、端到端产出，让\"听懂\"和\"译出\"在同一个序列里完成;Talker 再拿着译文和源音频，把译文合成为保留原说话人音色的语音——也就是说，翻译出来的声音还是那个讲话人的声音。\n在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上，它在翻译忠实度、流畅度、简洁度以及说话人分离错误率（DER）四个维度上，全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里，它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放，同传这个长期被专业译员把守的高门槛场景，正被大模型一步步推成人人可用的基础设施。","excerpt":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。\n在已经支持60种语言的基础上，新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离，每句话归到对应的人头上，音色复刻也更稳，不会再出现甲乙不分、声音串味;第二是原文译文同帧同出，双语同屏显示，听的人能边听边对;第三是长上下文消歧，模型会联系前文来读懂当下，人名、术语这类最容易翻错的地方精准度明显提升。\n底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计，靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列，按时序交替排列、端到端产出，让\"听懂\"和\"译出\"在同一个序列里完成;Talker 再拿着译文和源音频，把译文合成为保留原说话人音色的语音——也就是说，翻译出来的声音还是那个讲话人的声音。\n在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上，它在翻译忠实度、流畅度、简洁度以及说话人分离错误率（DER）四个维度上，全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里，它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放，同传这个长期被专业译员把守的高门槛场景，正被大模型一步步推成人人可用的基础设施。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 735 characters.","diagnostics_url":"/api/diagnose?url=https%3A//news.aibase.com/zh/news/31181","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 735 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":735,"summary_length":735,"usable_text_length":735,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":735,"summary_length":735}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"千问发布 Qwen3.8-LiveTranslate 同声传译大模型：原文译文同屏出，字均延迟压到 2.3 秒 - AIBase","url":"https://news.aibase.com/zh/news/31181","summary":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。\n在已经支持60种语言的基础上，新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离，每句话归到对应的人头上，音色复刻也更稳，不会再出现甲乙不分、声音串味;第二是原文译文同帧同出，双语同屏显示，听的人能边听边对;第三是长上下文消歧，模型会联系前文来读懂当下，人名、术语这类最容易翻错的地方精准度明显提升。\n底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计，靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列，按时序交替排列、端到端产出，让\"听懂\"和\"译出\"在同一个序列里完成;Talker 再拿着译文和源音频，把译文合成为保留原说话人音色的语音——也就是说，翻译出来的声音还是那个讲话人的声音。\n在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上，它在翻译忠实度、流畅度、简洁度以及说话人分离错误率（DER）四个维度上，全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里，它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放，同传这个长期被专业译员把守的高门槛场景，正被大模型一步步推成人人可用的基础设施。","source":"AIBase","date":"2026-09-20T01:51:00+00:00","content":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。\n在已经支持60种语言的基础上，新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离，每句话归到对应的人头上，音色复刻也更稳，不会再出现甲乙不分、声音串味;第二是原文译文同帧同出，双语同屏显示，听的人能边听边对;第三是长上下文消歧，模型会联系前文来读懂当下，人名、术语这类最容易翻错的地方精准度明显提升。\n底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计，靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列，按时序交替排列、端到端产出，让\"听懂\"和\"译出\"在同一个序列里完成;Talker 再拿着译文和源音频，把译文合成为保留原说话人音色的语音——也就是说，翻译出来的声音还是那个讲话人的声音。\n在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上，它在翻译忠实度、流畅度、简洁度以及说话人分离错误率（DER）四个维度上，全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里，它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放，同传这个长期被专业译员把守的高门槛场景，正被大模型一步步推成人人可用的基础设施。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//news.aibase.com/zh/news/31181","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 735 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 735 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":735,"summary_length":735,"usable_text_length":735,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":735,"summary_length":735}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/86175","export_markdown":"/api/items/86175/export?format=markdown","export_json":"/api/items/86175/export?format=json","diagnose":"/api/diagnose?url=https%3A//news.aibase.com/zh/news/31181"},"formats":{"full":{"id":86175,"title":"千问发布 Qwen3.8-LiveTranslate 同声传译大模型：原文译文同屏出，字均延迟压到 2.3 秒 - AIBase","url":"https://news.aibase.com/zh/news/31181","source":"AIBase","author":null,"published_at":"2026-09-20T01:51:00+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。\n在已经支持60种语言的基础上，新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离，每句话归到对应的人头上，音色复刻也更稳，不会再出现甲乙不分、声音串味;第二是原文译文同帧同出，双语同屏显示，听的人能边听边对;第三是长上下文消歧，模型会联系前文来读懂当下，人名、术语这类最容易翻错的地方精准度明显提升。\n底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计，靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列，按时序交替排列、端到端产出，让\"听懂\"和\"译出\"在同一个序列里完成;Talker 再拿着译文和源音频，把译文合成为保留原说话人音色的语音——也就是说，翻译出来的声音还是那个讲话人的声音。\n在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上，它在翻译忠实度、流畅度、简洁度以及说话人分离错误率（DER）四个维度上，全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里，它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放，同传这个长期被专业译员把守的高门槛场景，正被大模型一步步推成人人可用的基础设施。","full_text":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。\n在已经支持60种语言的基础上，新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离，每句话归到对应的人头上，音色复刻也更稳，不会再出现甲乙不分、声音串味;第二是原文译文同帧同出，双语同屏显示，听的人能边听边对;第三是长上下文消歧，模型会联系前文来读懂当下，人名、术语这类最容易翻错的地方精准度明显提升。\n底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计，靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列，按时序交替排列、端到端产出，让\"听懂\"和\"译出\"在同一个序列里完成;Talker 再拿着译文和源音频，把译文合成为保留原说话人音色的语音——也就是说，翻译出来的声音还是那个讲话人的声音。\n在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上，它在翻译忠实度、流畅度、简洁度以及说话人分离错误率（DER）四个维度上，全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里，它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放，同传这个长期被专业译员把守的高门槛场景，正被大模型一步步推成人人可用的基础设施。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 735 characters.","diagnostics_url":"/api/diagnose?url=https%3A//news.aibase.com/zh/news/31181","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 735 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":735,"summary_length":735,"usable_text_length":735,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":735,"summary_length":735}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 735 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":735,"summary_length":735,"usable_text_length":735,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":735,"summary_length":735}},"actions":{"read":"/item/86175","export_markdown":"/api/items/86175/export?format=markdown","export_json":"/api/items/86175/export?format=json","diagnose":"/api/diagnose?url=https%3A//news.aibase.com/zh/news/31181"}},"digest":{"id":86175,"title":"千问发布 Qwen3.8-LiveTranslate 同声传译大模型：原文译文同屏出，字均延迟压到 2.3 秒 - AIBase","url":"https://news.aibase.com/zh/news/31181","source":"AIBase","topic":"ai","published_at":"2026-09-20T01:51:00+00:00","excerpt":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 735 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"千问发布 Qwen3.8-LiveTranslate 同声传译大模型：原文译文同屏出，字均延迟压到 2.3 秒 - AIBase","subtitle":"AIBase · 2026-09-20","summary":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。…","badges":["quality:high"],"links":{"read":"/item/86175","original":"https://news.aibase.com/zh/news/31181","diagnose":"/api/diagnose?url=https%3A//news.aibase.com/zh/news/31181"},"quality_warning":null},"export":{"title":"千问发布 Qwen3.8-LiveTranslate 同声传译大模型：原文译文同屏出，字均延迟压到 2.3 秒 - AIBase","url":"https://news.aibase.com/zh/news/31181","summary":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。\n在已经支持60种语言的基础上，新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离，每句话归到对应的人头上，音色复刻也更稳，不会再出现甲乙不分、声音串味;第二是原文译文同帧同出，双语同屏显示，听的人能边听边对;第三是长上下文消歧，模型会联系前文来读懂当下，人名、术语这类最容易翻错的地方精准度明显提升。\n底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计，靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列，按时序交替排列、端到端产出，让\"听懂\"和\"译出\"在同一个序列里完成;Talker 再拿着译文和源音频，把译文合成为保留原说话人音色的语音——也就是说，翻译出来的声音还是那个讲话人的声音。\n在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上，它在翻译忠实度、流畅度、简洁度以及说话人分离错误率（DER）四个维度上，全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里，它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放，同传这个长期被专业译员把守的高门槛场景，正被大模型一步步推成人人可用的基础设施。","source":"AIBase","date":"2026-09-20T01:51:00+00:00","content":"阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍，准确度、流畅度和简洁度一起往上抬，字均延迟（LAAL）从2.8秒降到2.3秒——对同传这种\"慢一秒就跟不上讲话人\"的场景来说，这0.5秒的压缩直接决定了听感是否自然。\n在已经支持60种语言的基础上，新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离，每句话归到对应的人头上，音色复刻也更稳，不会再出现甲乙不分、声音串味;第二是原文译文同帧同出，双语同屏显示，听的人能边听边对;第三是长上下文消歧，模型会联系前文来读懂当下，人名、术语这类最容易翻错的地方精准度明显提升。\n底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计，靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列，按时序交替排列、端到端产出，让\"听懂\"和\"译出\"在同一个序列里完成;Talker 再拿着译文和源音频，把译文合成为保留原说话人音色的语音——也就是说，翻译出来的声音还是那个讲话人的声音。\n在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上，它在翻译忠实度、流畅度、简洁度以及说话人分离错误率（DER）四个维度上，全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里，它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放，同传这个长期被专业译员把守的高门槛场景，正被大模型一步步推成人人可用的基础设施。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//news.aibase.com/zh/news/31181","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 735 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 735 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":735,"summary_length":735,"usable_text_length":735,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":735,"summary_length":735}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}