{"id":84248,"topic":"ai","source":"Sohu","title":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了... - Sohu","url":"https://m.sohu.com/a/1076837364_121613636?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","url_hash":"7eabf61798c6f0fa4e6fff569a2c86133d13eb21","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMijAFBVV95cUxOR2ZKZ3QwUXQ2NzczX3I3ZllLMDZkZHRCRGNFbkd4UUU2TmJUb2swSWl3T3NadmFTMWYtbnZJLUVJaGh1Qm9tV2FYYXFSNzU5SDJ3TkNhVDFXWVhqZFU4X1ZCY2dqc2ZGczI4NjVPWExJTDE3Yi1zMWU0dXNhXzRSa0dFT2hFOS0tVzE0ZA?oc=5\" target=\"_blank\">讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">Sohu</font>","content":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...\n今天，Spark-Audio-1.0-Preview上线啦\n——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板： 信息丢失。文字只能记录说了什么，会丢掉语音里自带的语气、情绪，还有背景环境音等关键信息，导致模型对场景的判断不完整，自然也会影响到最后的结果。链路割裂。这套系统把语音转写、声纹识别、语音翻译等能力拆成独立模块串联运行，模块之间存在断点，不仅容易累积错误，在使用体验上也会出现延迟、卡顿。语音基座大模型就解决了上面的这些问题：它不再只做语音转文字，而是直接理解语音。语音基座大模型一次性听懂人声、环境音、音乐等等，而且还能理解声音里的语义、情绪和场景。","image_url":"//q2.itc.cn/q_70/images03/20260916/f95a72274d704dca9be5ddb617ff5ee0.jpeg","lang":"zh","published_at":"2026-09-16T07:44:28+00:00","fetched_at":"2026-09-17T03:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...\n今天，Spark-Audio-1.0-Preview上线啦\n——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板：…","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://m.sohu.com/a/1076837364_121613636?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 395 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":395,"summary_length":170,"usable_text_length":395,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":395,"summary_length":170}},"news_item":{"id":84248,"canonical_url":"https://m.sohu.com/a/1076837364_121613636?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source_url":"https://m.sohu.com/a/1076837364_121613636?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","title":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了... - Sohu","source_name":"Sohu","author":null,"published_at":"2026-09-16T07:44:28+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMijAFBVV95cUxOR2ZKZ3QwUXQ2NzczX3I3ZllLMDZkZHRCRGNFbkd4UUU2TmJUb2swSWl3T3NadmFTMWYtbnZJLUVJaGh1Qm9tV2FYYXFSNzU5SDJ3TkNhVDFXWVhqZFU4X1ZCY2dqc2ZGczI4NjVPWExJTDE3Yi1zMWU0dXNhXzRSa0dFT2hFOS0tVzE0ZA?oc=5\" target=\"_blank\">讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">Sohu</font>","full_text":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...\n今天，Spark-Audio-1.0-Preview上线啦\n——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板： 信息丢失。文字只能记录说了什么，会丢掉语音里自带的语气、情绪，还有背景环境音等关键信息，导致模型对场景的判断不完整，自然也会影响到最后的结果。链路割裂。这套系统把语音转写、声纹识别、语音翻译等能力拆成独立模块串联运行，模块之间存在断点，不仅容易累积错误，在使用体验上也会出现延迟、卡顿。语音基座大模型就解决了上面的这些问题：它不再只做语音转文字，而是直接理解语音。语音基座大模型一次性听懂人声、环境音、音乐等等，而且还能理解声音里的语义、情绪和场景。","excerpt":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...\n今天，Spark-Audio-1.0-Preview上线啦\n——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板：…","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 395 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1076837364_121613636%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 395 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":395,"summary_length":170,"usable_text_length":395,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":395,"summary_length":170}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了... - Sohu","url":"https://m.sohu.com/a/1076837364_121613636?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...\n今天，Spark-Audio-1.0-Preview上线啦\n——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板：…","source":"Sohu","date":"2026-09-16T07:44:28+00:00","content":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...\n今天，Spark-Audio-1.0-Preview上线啦\n——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板： 信息丢失。文字只能记录说了什么，会丢掉语音里自带的语气、情绪，还有背景环境音等关键信息，导致模型对场景的判断不完整，自然也会影响到最后的结果。链路割裂。这套系统把语音转写、声纹识别、语音翻译等能力拆成独立模块串联运行，模块之间存在断点，不仅容易累积错误，在使用体验上也会出现延迟、卡顿。语音基座大模型就解决了上面的这些问题：它不再只做语音转文字，而是直接理解语音。语音基座大模型一次性听懂人声、环境音、音乐等等，而且还能理解声音里的语义、情绪和场景。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1076837364_121613636%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 395 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 395 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":395,"summary_length":170,"usable_text_length":395,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":395,"summary_length":170}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/84248","export_markdown":"/api/items/84248/export?format=markdown","export_json":"/api/items/84248/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1076837364_121613636%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"formats":{"full":{"id":84248,"title":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了... - Sohu","url":"https://m.sohu.com/a/1076837364_121613636?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"Sohu","author":null,"published_at":"2026-09-16T07:44:28+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...\n今天，Spark-Audio-1.0-Preview上线啦\n——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板：…","full_text":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...\n今天，Spark-Audio-1.0-Preview上线啦\n——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板： 信息丢失。文字只能记录说了什么，会丢掉语音里自带的语气、情绪，还有背景环境音等关键信息，导致模型对场景的判断不完整，自然也会影响到最后的结果。链路割裂。这套系统把语音转写、声纹识别、语音翻译等能力拆成独立模块串联运行，模块之间存在断点，不仅容易累积错误，在使用体验上也会出现延迟、卡顿。语音基座大模型就解决了上面的这些问题：它不再只做语音转文字，而是直接理解语音。语音基座大模型一次性听懂人声、环境音、音乐等等，而且还能理解声音里的语义、情绪和场景。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 395 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1076837364_121613636%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 395 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":395,"summary_length":170,"usable_text_length":395,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":395,"summary_length":170}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 395 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":395,"summary_length":170,"usable_text_length":395,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":395,"summary_length":170}},"actions":{"read":"/item/84248","export_markdown":"/api/items/84248/export?format=markdown","export_json":"/api/items/84248/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1076837364_121613636%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"}},"digest":{"id":84248,"title":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了... - Sohu","url":"https://m.sohu.com/a/1076837364_121613636?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"Sohu","topic":"ai","published_at":"2026-09-16T07:44:28+00:00","excerpt":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了... 今天，Spark-Audio-1.0-Preview上线啦 ——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板：…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 395 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了... - Sohu","subtitle":"Sohu · 2026-09-16","summary":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了... 今天，Spark-Audio-1.0-Preview上线啦 ——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板：…","badges":["quality:high"],"links":{"read":"/item/84248","original":"https://m.sohu.com/a/1076837364_121613636?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1076837364_121613636%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"quality_warning":null},"export":{"title":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了... - Sohu","url":"https://m.sohu.com/a/1076837364_121613636?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...\n今天，Spark-Audio-1.0-Preview上线啦\n——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板：…","source":"Sohu","date":"2026-09-16T07:44:28+00:00","content":"讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了...\n今天，Spark-Audio-1.0-Preview上线啦\n——一款基于全国产化算力训练的语音基座大模型。大家对大模型并不陌生，语音基座大模型又是什么呢？过去，我们处理音频大多采用级联方案：先把语音转成文字，再交给大模型理解。这种做法有两个明显短板： 信息丢失。文字只能记录说了什么，会丢掉语音里自带的语气、情绪，还有背景环境音等关键信息，导致模型对场景的判断不完整，自然也会影响到最后的结果。链路割裂。这套系统把语音转写、声纹识别、语音翻译等能力拆成独立模块串联运行，模块之间存在断点，不仅容易累积错误，在使用体验上也会出现延迟、卡顿。语音基座大模型就解决了上面的这些问题：它不再只做语音转文字，而是直接理解语音。语音基座大模型一次性听懂人声、环境音、音乐等等，而且还能理解声音里的语义、情绪和场景。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1076837364_121613636%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 395 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 395 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":395,"summary_length":170,"usable_text_length":395,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":395,"summary_length":170}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}