{"id":51481,"topic":"ai","source":"Sohu","title":"全球语音大模型，角逐方向盘后的麦克风 - Sohu","url":"https://m.sohu.com/a/1057823678_116132?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","url_hash":"8ba1f0c094bb67d3a68c9c2ca06bbdf3b1505bc7","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiiAFBVV95cUxOWXJXQ1BCOWxObk5fV2NNMTBJOEdFZ3JYR3BfNDFGWjVNUTU1ckFwQ0FnejVobzgxZTVTUVhhRVl3RUtZLVdmX1RJemVIb0EwckxiVk5walRWLXBXSFJvT0FIMEFOVUROTEh5b2Z5QUZWZWtEbGdZOW0zR011RFZNUm5jTlg0aUwx?oc=5\" target=\"_blank\">全球语音大模型，角逐方向盘后的麦克风</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">Sohu</font>","content":"全球语音大模型，角逐方向盘后的麦克风\n语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。\n7月，实时语音Agent战场上连爆多颗信号弹。\n7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。\n7月28日，阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录，登顶全球语音推理排行榜，但它的平均首音延迟高达4.02秒。7月29日，SpaceXAI（原xAI）发布Grok Voice Think Fast 2.0，首音延迟压到0.70秒，Big Bench Audio得分97.2%，在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先，GPT-Realtime-2.1 High是45.7%，Gemini 3.1 Flash High是37.7%。更早一些，7月6日，OpenAI也发布了GPT-Realtime-2.1。\nSpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦，而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。\n一场“毫秒级”军备竞赛\n过去半年，实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上：首音延迟、语音识别精度、调用成本。\n先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒，从用户说完话到AI开口，在大多数人尚未察觉的间隙就已完成了应答。作为对比，v1.0的TTFA是1.25秒，GPT-Realtime-2高推理模式是2.33秒，Gemini 3.1 Flash High是2.98秒，Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中，Grok TTS的流式模式首音延迟已压到285毫秒，标准模式460毫秒。2.0在此基础上进一步优化了推理效率：推理token减少60%，工具调用可以在用户说完第一句话之前就开始执行。\nxAI从一开始就把语音管线做成了一体化，自研语音活动检测、自研音频分词器、自研端到端语音模型，传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释：每绕过一层中间件，就省掉一层延迟和一层错误概率。\n在Artificial Analysis的综合语音质量指数上，Think Fast 2.0总评分82.9%，较v1.0的75.7%提升9.5%，超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%；Full Duplex Bench从77.8%跳升至95.1%，逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计，10倍于上一代，远超专业转录模型的水平。\n但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录，超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景：Flash面向实时交互（首包延迟300毫秒级）、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中，4秒意味着不可用。\n这个矛盾暴露了当前技术竞赛中一个绕不开的取舍：追求极致推理精度的模型，往往在延迟上买单，Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域，延迟是物理天花板，0.5秒以内的延迟让人感觉“在对话”，1.5秒左右就变成了“在等机器人”，到4秒，用户只会觉得“这功能坏了”。\nOpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后，旗舰模型音频输入32/百万token、输出64/百万token，mini版10和20。理论折算约0.05/分钟，独立开发者实测的数据则迅速偏离理论值，一个房产导览AI的实际均价约0.07/分钟，最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀，是OpenAI语音模型商业化绕不开的难题。\nGoogle Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉，某些模型版本从500毫秒增至1800毫秒，甚至10秒以上的等待，暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商，这种不稳定性比“慢”更致命。\n如果再把镜头拉远一点，比七月更早落子的还有两个重量级玩家。\n微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口，开发者不需要自己拼接语音管线。更关键的是微软的双重身份：它既是GPT-Realtime-2.1的云平台宿主（企业客户通过Azure调用OpenAI模型），又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通，支持WebSocket和WebRTC低延迟连接，直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线，客户一旦把语音Agent跑在Azure上，迁移成本远比切换一个API端点高得多。\nMeta则在开源侧投下了一枚重弹。4月，Meta以Apache 2.0协议开源了Llama-Voice，一个7B参数的TTS基础模型，支持52种语言，10秒音频即可零样本声音克隆，能在消费级GPU上实时运行。上线48小时下载量突破80万，社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2，支持100多种语言的实时语音翻译，延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端，Meta拥有从开源模型到消费硬件的完整通路，OpenAI恰好缺这一块。\n端到端、混合路由、轮次制、拼积木\nSpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下，但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊，至少能看到四种截然不同的技术选择。\n最激进的是Grok Voice的原生端到端路线。音频输入、音频输出，全由一个模型完成。这套架构最大胆的一点，是它在WebSocket连接中直接处理原始音频信号，不经过ASR转文本，也不经过TTS合成。60%的推理token压缩从侧面印证了这一点，2.0不需要把用户说的每句话都拆成详细文本再推理，模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%，而ElevenLabs为12.0%、Deepgram为13.5%。\n相比之下，OpenAI的Realtime API虽然标称支持端到端，在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费，上下文越长越贵，缓存机制（0.40/百万输入token旗舰版）只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着，用户的每一轮追问都在悄悄抬高账单。\nAnthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。\nAnthropic选择轮次制（listen→think→speak）而非全双工，以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞，同时连接Gmail、Calendar、Slack等应用，每一步操作前都要求用户确认，核心逻辑是语音不只是一个交互界面，它应该能推动真实的工作流程。代价是交互节奏不如全双工自然，但在需要深思熟虑的场景中，轮次制的深度优于全双工的流畅。\n亚马逊走多模型路由，通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理，各司其职。6亿台Echo终端是Alexa的基本盘，但7月升级释放了更重要的信号，Alexa+已经跨出硬件，进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目，投入超过1亿美元GPU算力，目标是实现多任务联动交互，但高昂成本已在内部引发争议。\n这两家的共同判断是“不为全双工牺牲其他能力”，在大多数生产力场景中，用户要的是一个靠谱的结果，而不是一个能随时插话的聊天对象。\n而在光谱的另一端，Deepgram和AssemblyAI代表的传统语音专业厂商，仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%，低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的，每增加一个中间环节，就多一层延迟。对于车载和穿戴场景，传统流水线的天花板约在600至1500毫秒，而端到端方案已经下探到了300毫秒以下。\n这四种路线之外，还有一个不可忽视的变量正在浮现：端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行，都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束，待高通、苹果和车企定制芯片的迭代完成后，端侧语音推理有可能在2027至2028年进入主流量产。届时，云端语音API的商业模式将面临根本性挑战。\n当屏幕不再是默认界面\n从定价策略来看，SpaceXAI的战略意图很清晰。\nGrok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟，但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是，grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。\nOpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时，比GPT-Realtime-2.1的10.75/小时便宜六成，但比Grok Voice贵了近一倍。\n单独看每分钟几美分的价差微不足道。换算成商业场景：一个月10万分钟通话量（对大型客服中心而言并不罕见），Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互，价差将以百万美元计。\n但真正透露战略野心的，是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式，不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符，比OpenAI的约30低86%，比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略，只有在马斯克手中同时掌握特斯拉（终端）、Starlink（网络）和X（数据与分发）时才有商业合理性。语音API可以薄利甚至亏损，生态内的其他环节会加倍赚回来。\n这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑，与当年AWS碾压传统IDC如出一辙。\n特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱，它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力，每一次对话既是一次A/B测试，也是一条训练数据。\n车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据，全球车载语音助手市场2025年约为84亿美元，预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作，计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断，在自动驾驶逐步解放双手之后，语音将成为座舱的主交互通道。\n穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框；Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商，但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定，这本身就说明了一个事实，硬件厂商没有忠诚度，只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势，硬件厂商的切换只是时间问题。\n中国阵营，谁是主力？\n国内实时语音的竞争格局，远比一两家公司撑起来的场面要热闹。\n阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道，国内至少还有五家公司在同一方向上投入了实质性力量。\n字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构，已在超过700万辆量产车上落地，覆盖50多个汽车品牌。2026年4月，Seeduplex完成了新一轮升级，通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆，既有自研模型，又有抖音和火山引擎的庞大分发网络。\nMiniMax走的是另一条路：扎根语音基础设施，把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下，支持40多种语言，已被LiveKit（ChatGPT高级语音模式的技术栈）、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧，Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确：不跟OpenAI和SpaceXAI在通用大模型上正面拼，而在语音这个垂直层做到“谁的管道里都有我”。\n科大讯飞是语音领域的资深玩家，在国内市场的根基远比其他几家深厚。据IDC数据，讯飞在语音语义市场的份额为15.6%，位居第一。2026年2月发布的星火X2大模型基于全国产算力训练，6月集中发布了四款企业级AI应用，将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上，而在垂直场景的深度渗透：教育口语测评、医疗语音病历、政务热线智能坐席、车载语音，每一块都是需要行业know-how的硬骨头。\n百度在语音大模型上的投入也值得留意。2026年1月，百度发布了业界首个基于Cross-Attention的端到端语音语言大模型，响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次，依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络（比亚迪、吉利等12家车企搭载了小度车载系统），在“模型加终端”的维度上，百度是国内极少数能与字节对标的企业。\n智谱AI的GLM-4-Voice于2024年10月上线，是国内最早一批端到端语音大模型之一，在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音（98%准确率、方言识别提升30%）、腾讯视频的角色扮演语音通话等产品矩阵，把语音AI嵌入已有的超级App生态中。\n这六家中国公司加上阿里云，构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同，但在一个方向上高度重合：车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手，但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间，天壤之别。\n三个信号\n实时语音Agent的战局给出了三个清晰信号。\n速度即护城河。在文本大模型领域，一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中，100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先，但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒，这不只是快慢之分，是能用与不能用的区别。\n这个物理天花板指向一个清楚的终局，端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面：速度不是唯一标准，在需要深度推理和可靠执行的场景中，“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利，而是端到端、轮次制和混合路由各自占据不同场景的生态位。\n硬件决定终局。纯API模型公司正在面对一个现实，没有自有硬件终端，语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作，凡是拥有硬件出口的公司，在语音入口争夺中天然多一条命。\nOpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域，将在下一阶段处于被动。中国市场正以另一套武器打同一场仗，讯飞、字节、百度、阿里在车企供应链中的位置之战，复刻着同一逻辑。语音入口的竞争，说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型，迁移成本也会使替换变得不划算。一旦被设为默认，换掉它的交易成本就高到让多数人选择忍受。\n定价只是起点。Grok TTS定价比ElevenLabs低90%，Llama-Voice开源免费，MiniMax以250毫秒延迟服务全球平台，语音基础设施的价格正在被全面压平，但这只是表层。SpaceXAI靠生态反哺（特斯拉、Starlink、X），Meta靠开源铺设分发管道，微软靠平台锁定企业客户，亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式，真正的利润在生态的其他环节。\n对于开发者和硬件厂商，此刻需要做一个关键决策：绑定单一模型，还是多模型冗余？前者的成本最低但锁定风险最高；后者的延迟和体验优化复杂度将成倍增加。无论走哪条路，都不能再用“等一等再看”的心态观望。语音入口的窗口期，不会超过18个月。\n语音不是大模型的附加功能，它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下，比API合同难解除得多。（本文首发钛媒体APP，作者 | AGI-Signal，编辑 | 秦聪慧）","image_url":"https://q3.itc.cn/q_70/images03/20260802/4ba0b00e0d6343adb286fb121e291d01.png","lang":"zh","published_at":"2026-08-02T04:45:33+00:00","fetched_at":"2026-08-02T05:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"全球语音大模型，角逐方向盘后的麦克风\n语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。\n7月，实时语音Agent战场上连爆多颗信号弹。\n7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。\n7月28日，阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录，登顶全球语音推理排行榜，但它的平均首音延迟高达4.02秒。7月29日，SpaceXAI（原xAI）发布Grok Voice Think Fast 2.0，首音延迟压到0.70秒，Big Bench Audio得分97.2%，在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先，GPT-Realtime-2.1 High是45.7%，Gemini 3.1 Flash High是37.7%。更早一些，7月6日，OpenAI也发布了GPT-Realtime-2.1。\nSpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦，而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。\n一场“毫秒级”军备竞赛\n过去半年，实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上：首音延迟、语音识别精度、调用成本。\n先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒，从用户说完话到AI开口，在大多数人尚未察觉的间隙就已完成了应答。作为对比，v1.0的TTFA是1.25秒，GPT-Realtime-2高推理模式是2.33秒，Gemini 3.1 Flash High是2.98秒，Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中，Grok TTS的流式模式首音延迟已压到285毫秒，标准模式460毫秒。2.0在此基础上进一步优化了推理效率：推理token减少60%，工具调用可以在用户说完第一句话之前就开始执行。\nxAI从一开始就把语音管线做成了一体化，自研语音活动检测、自研音频分词器、自研端到端语音模型，传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释：每绕过一层中间件，就省掉一层延迟和一层错误概率。\n在Artificial Analysis的综合语音质量指数上，Think Fast 2.0总评分82.9%，较v1.0的75.7%提升9.5%，超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%；Full Duplex Bench从77.8%跳升至95.1%，逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计，10倍于上一代，远超专业转录模型的水平。\n但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录，超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景：Flash面向实时交互（首包延迟300毫秒级）、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中，4秒意味着不可用。\n这个矛盾暴露了当前技术竞赛中一个绕不开的取舍：追求极致推理精度的模型，往往在延迟上买单，Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域，延迟是物理天花板，0.5秒以内的延迟让人感觉“在对话”，1.5秒左右就变成了“在等机器人”，到4秒，用户只会觉得“这功能坏了”。\nOpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后，旗舰模型音频输入32/百万token、输出64/百万token，mini版10和20。理论折算约0.05/分钟，独立开发者实测的数据则迅速偏离理论值，一个房产导览AI的实际均价约0.07/分钟，最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀，是OpenAI语音模型商业化绕不开的难题。\nGoogle Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉，某些模型版本从500毫秒增至1800毫秒，甚至10秒以上的等待，暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商，这种不稳定性比“慢”更致命。\n如果再把镜头拉远一点，比七月更早落子的还有两个重量级玩家。\n微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口，开发者不需要自己拼接语音管线。更关键的是微软的双重身份：它既是GPT-Realtime-2.1的云平台宿主（企业客户通过Azure调用OpenAI模型），又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通，支持WebSocket和WebRTC低延迟连接，直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线，客户一旦把语音Agent跑在Azure上，迁移成本远比切换一个API端点高得多。\nMeta则在开源侧投下了一枚重弹。4月，Meta以Apache 2.0协议开源了Llama-Voice，一个7B参数的TTS基础模型，支持52种语言，10秒音频即可零样本声音克隆，能在消费级GPU上实时运行。上线48小时下载量突破80万，社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2，支持100多种语言的实时语音翻译，延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端，Meta拥有从开源模型到消费硬件的完整通路，OpenAI恰好缺这一块。\n端到端、混合路由、轮次制、拼积木\nSpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下，但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊，至少能看到四种截然不同的技术选择。\n最激进的是Grok Voice的原生端到端路线。音频输入、音频输出，全由一个模型完成。这套架构最大胆的一点，是它在WebSocket连接中直接处理原始音频信号，不经过ASR转文本，也不经过TTS合成。60%的推理token压缩从侧面印证了这一点，2.0不需要把用户说的每句话都拆成详细文本再推理，模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%，而ElevenLabs为12.0%、Deepgram为13.5%。\n相比之下，OpenAI的Realtime API虽然标称支持端到端，在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费，上下文越长越贵，缓存机制（0.40/百万输入token旗舰版）只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着，用户的每一轮追问都在悄悄抬高账单。\nAnthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。\nAnthropic选择轮次制（listen→think→speak）而非全双工，以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞，同时连接Gmail、Calendar、Slack等应用，每一步操作前都要求用户确认，核心逻辑是语音不只是一个交互界面，它应该能推动真实的工作流程。代价是交互节奏不如全双工自然，但在需要深思熟虑的场景中，轮次制的深度优于全双工的流畅。\n亚马逊走多模型路由，通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理，各司其职。6亿台Echo终端是Alexa的基本盘，但7月升级释放了更重要的信号，Alexa+已经跨出硬件，进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目，投入超过1亿美元GPU算力，目标是实现多任务联动交互，但高昂成本已在内部引发争议。\n这两家的共同判断是“不为全双工牺牲其他能力”，在大多数生产力场景中，用户要的是一个靠谱的结果，而不是一个能随时插话的聊天对象。\n而在光谱的另一端，Deepgram和AssemblyAI代表的传统语音专业厂商，仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%，低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的，每增加一个中间环节，就多一层延迟。对于车载和穿戴场景，传统流水线的天花板约在600至1500毫秒，而端到端方案已经下探到了300毫秒以下。\n这四种路线之外，还有一个不可忽视的变量正在浮现：端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行，都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束，待高通、苹果和车企定制芯片的迭代完成后，端侧语音推理有可能在2027至2028年进入主流量产。届时，云端语音API的商业模式将面临根本性挑战。\n当屏幕不再是默认界面\n从定价策略来看，SpaceXAI的战略意图很清晰。\nGrok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟，但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是，grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。\nOpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时，比GPT-Realtime-2.1的10.75/小时便宜六成，但比Grok Voice贵了近一倍。\n单独看每分钟几美分的价差微不足道。换算成商业场景：一个月10万分钟通话量（对大型客服中心而言并不罕见），Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互，价差将以百万美元计。\n但真正透露战略野心的，是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式，不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符，比OpenAI的约30低86%，比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略，只有在马斯克手中同时掌握特斯拉（终端）、Starlink（网络）和X（数据与分发）时才有商业合理性。语音API可以薄利甚至亏损，生态内的其他环节会加倍赚回来。\n这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑，与当年AWS碾压传统IDC如出一辙。\n特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱，它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力，每一次对话既是一次A/B测试，也是一条训练数据。\n车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据，全球车载语音助手市场2025年约为84亿美元，预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作，计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断，在自动驾驶逐步解放双手之后，语音将成为座舱的主交互通道。\n穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框；Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商，但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定，这本身就说明了一个事实，硬件厂商没有忠诚度，只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势，硬件厂商的切换只是时间问题。\n中国阵营，谁是主力？\n国内实时语音的竞争格局，远比一两家公司撑起来的场面要热闹。\n阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道，国内至少还有五家公司在同一方向上投入了实质性力量。\n字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构，已在超过700万辆量产车上落地，覆盖50多个汽车品牌。2026年4月，Seeduplex完成了新一轮升级，通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆，既有自研模型，又有抖音和火山引擎的庞大分发网络。\nMiniMax走的是另一条路：扎根语音基础设施，把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下，支持40多种语言，已被LiveKit（ChatGPT高级语音模式的技术栈）、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧，Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确：不跟OpenAI和SpaceXAI在通用大模型上正面拼，而在语音这个垂直层做到“谁的管道里都有我”。\n科大讯飞是语音领域的资深玩家，在国内市场的根基远比其他几家深厚。据IDC数据，讯飞在语音语义市场的份额为15.6%，位居第一。2026年2月发布的星火X2大模型基于全国产算力训练，6月集中发布了四款企业级AI应用，将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上，而在垂直场景的深度渗透：教育口语测评、医疗语音病历、政务热线智能坐席、车载语音，每一块都是需要行业know-how的硬骨头。\n百度在语音大模型上的投入也值得留意。2026年1月，百度发布了业界首个基于Cross-Attention的端到端语音语言大模型，响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次，依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络（比亚迪、吉利等12家车企搭载了小度车载系统），在“模型加终端”的维度上，百度是国内极少数能与字节对标的企业。\n智谱AI的GLM-4-Voice于2024年10月上线，是国内最早一批端到端语音大模型之一，在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音（98%准确率、方言识别提升30%）、腾讯视频的角色扮演语音通话等产品矩阵，把语音AI嵌入已有的超级App生态中。\n这六家中国公司加上阿里云，构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同，但在一个方向上高度重合：车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手，但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间，天壤之别。\n三个信号\n实时语音Agent的战局给出了三个清晰信号。\n速度即护城河。在文本大模型领域，一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中，100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先，但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒，这不只是快慢之分，是能用与不能用的区别。\n这个物理天花板指向一个清楚的终局，端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面：速度不是唯一标准，在需要深度推理和可靠执行的场景中，“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利，而是端到端、轮次制和混合路由各自占据不同场景的生态位。\n硬件决定终局。纯API模型公司正在面对一个现实，没有自有硬件终端，语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作，凡是拥有硬件出口的公司，在语音入口争夺中天然多一条命。\nOpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域，将在下一阶段处于被动。中国市场正以另一套武器打同一场仗，讯飞、字节、百度、阿里在车企供应链中的位置之战，复刻着同一逻辑。语音入口的竞争，说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型，迁移成本也会使替换变得不划算。一旦被设为默认，换掉它的交易成本就高到让多数人选择忍受。\n定价只是起点。Grok TTS定价比ElevenLabs低90%，Llama-Voice开源免费，MiniMax以250毫秒延迟服务全球平台，语音基础设施的价格正在被全面压平，但这只是表层。SpaceXAI靠生态反哺（特斯拉、Starlink、X），Meta靠开源铺设分发管道，微软靠平台锁定企业客户，亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式，真正的利润在生态的其他环节。\n对于开发者和硬件厂商，此刻需要做一个关键决策：绑定单一模型，还是多模型冗余？前者的成本最低但锁定风险最高；后者的延迟和体验优化复杂度将成倍增加。无论走哪条路，都不能再用“等一等再看”的心态观望。语音入口的窗口期，不会超过18个月。\n语音不是大模型的附加功能，它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下，比API合同难解除得多。（本文首发钛媒体APP，作者 | AGI-Signal，编辑 | 秦聪慧）","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://m.sohu.com/a/1057823678_116132?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 8192 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":8192,"summary_length":8192,"usable_text_length":8192,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":8192,"summary_length":8192}},"news_item":{"id":51481,"canonical_url":"https://m.sohu.com/a/1057823678_116132?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source_url":"https://m.sohu.com/a/1057823678_116132?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","title":"全球语音大模型，角逐方向盘后的麦克风 - Sohu","source_name":"Sohu","author":null,"published_at":"2026-08-02T04:45:33+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiiAFBVV95cUxOWXJXQ1BCOWxObk5fV2NNMTBJOEdFZ3JYR3BfNDFGWjVNUTU1ckFwQ0FnejVobzgxZTVTUVhhRVl3RUtZLVdmX1RJemVIb0EwckxiVk5walRWLXBXSFJvT0FIMEFOVUROTEh5b2Z5QUZWZWtEbGdZOW0zR011RFZNUm5jTlg0aUwx?oc=5\" target=\"_blank\">全球语音大模型，角逐方向盘后的麦克风</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">Sohu</font>","full_text":"全球语音大模型，角逐方向盘后的麦克风\n语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。\n7月，实时语音Agent战场上连爆多颗信号弹。\n7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。\n7月28日，阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录，登顶全球语音推理排行榜，但它的平均首音延迟高达4.02秒。7月29日，SpaceXAI（原xAI）发布Grok Voice Think Fast 2.0，首音延迟压到0.70秒，Big Bench Audio得分97.2%，在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先，GPT-Realtime-2.1 High是45.7%，Gemini 3.1 Flash High是37.7%。更早一些，7月6日，OpenAI也发布了GPT-Realtime-2.1。\nSpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦，而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。\n一场“毫秒级”军备竞赛\n过去半年，实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上：首音延迟、语音识别精度、调用成本。\n先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒，从用户说完话到AI开口，在大多数人尚未察觉的间隙就已完成了应答。作为对比，v1.0的TTFA是1.25秒，GPT-Realtime-2高推理模式是2.33秒，Gemini 3.1 Flash High是2.98秒，Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中，Grok TTS的流式模式首音延迟已压到285毫秒，标准模式460毫秒。2.0在此基础上进一步优化了推理效率：推理token减少60%，工具调用可以在用户说完第一句话之前就开始执行。\nxAI从一开始就把语音管线做成了一体化，自研语音活动检测、自研音频分词器、自研端到端语音模型，传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释：每绕过一层中间件，就省掉一层延迟和一层错误概率。\n在Artificial Analysis的综合语音质量指数上，Think Fast 2.0总评分82.9%，较v1.0的75.7%提升9.5%，超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%；Full Duplex Bench从77.8%跳升至95.1%，逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计，10倍于上一代，远超专业转录模型的水平。\n但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录，超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景：Flash面向实时交互（首包延迟300毫秒级）、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中，4秒意味着不可用。\n这个矛盾暴露了当前技术竞赛中一个绕不开的取舍：追求极致推理精度的模型，往往在延迟上买单，Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域，延迟是物理天花板，0.5秒以内的延迟让人感觉“在对话”，1.5秒左右就变成了“在等机器人”，到4秒，用户只会觉得“这功能坏了”。\nOpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后，旗舰模型音频输入32/百万token、输出64/百万token，mini版10和20。理论折算约0.05/分钟，独立开发者实测的数据则迅速偏离理论值，一个房产导览AI的实际均价约0.07/分钟，最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀，是OpenAI语音模型商业化绕不开的难题。\nGoogle Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉，某些模型版本从500毫秒增至1800毫秒，甚至10秒以上的等待，暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商，这种不稳定性比“慢”更致命。\n如果再把镜头拉远一点，比七月更早落子的还有两个重量级玩家。\n微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口，开发者不需要自己拼接语音管线。更关键的是微软的双重身份：它既是GPT-Realtime-2.1的云平台宿主（企业客户通过Azure调用OpenAI模型），又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通，支持WebSocket和WebRTC低延迟连接，直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线，客户一旦把语音Agent跑在Azure上，迁移成本远比切换一个API端点高得多。\nMeta则在开源侧投下了一枚重弹。4月，Meta以Apache 2.0协议开源了Llama-Voice，一个7B参数的TTS基础模型，支持52种语言，10秒音频即可零样本声音克隆，能在消费级GPU上实时运行。上线48小时下载量突破80万，社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2，支持100多种语言的实时语音翻译，延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端，Meta拥有从开源模型到消费硬件的完整通路，OpenAI恰好缺这一块。\n端到端、混合路由、轮次制、拼积木\nSpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下，但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊，至少能看到四种截然不同的技术选择。\n最激进的是Grok Voice的原生端到端路线。音频输入、音频输出，全由一个模型完成。这套架构最大胆的一点，是它在WebSocket连接中直接处理原始音频信号，不经过ASR转文本，也不经过TTS合成。60%的推理token压缩从侧面印证了这一点，2.0不需要把用户说的每句话都拆成详细文本再推理，模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%，而ElevenLabs为12.0%、Deepgram为13.5%。\n相比之下，OpenAI的Realtime API虽然标称支持端到端，在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费，上下文越长越贵，缓存机制（0.40/百万输入token旗舰版）只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着，用户的每一轮追问都在悄悄抬高账单。\nAnthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。\nAnthropic选择轮次制（listen→think→speak）而非全双工，以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞，同时连接Gmail、Calendar、Slack等应用，每一步操作前都要求用户确认，核心逻辑是语音不只是一个交互界面，它应该能推动真实的工作流程。代价是交互节奏不如全双工自然，但在需要深思熟虑的场景中，轮次制的深度优于全双工的流畅。\n亚马逊走多模型路由，通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理，各司其职。6亿台Echo终端是Alexa的基本盘，但7月升级释放了更重要的信号，Alexa+已经跨出硬件，进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目，投入超过1亿美元GPU算力，目标是实现多任务联动交互，但高昂成本已在内部引发争议。\n这两家的共同判断是“不为全双工牺牲其他能力”，在大多数生产力场景中，用户要的是一个靠谱的结果，而不是一个能随时插话的聊天对象。\n而在光谱的另一端，Deepgram和AssemblyAI代表的传统语音专业厂商，仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%，低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的，每增加一个中间环节，就多一层延迟。对于车载和穿戴场景，传统流水线的天花板约在600至1500毫秒，而端到端方案已经下探到了300毫秒以下。\n这四种路线之外，还有一个不可忽视的变量正在浮现：端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行，都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束，待高通、苹果和车企定制芯片的迭代完成后，端侧语音推理有可能在2027至2028年进入主流量产。届时，云端语音API的商业模式将面临根本性挑战。\n当屏幕不再是默认界面\n从定价策略来看，SpaceXAI的战略意图很清晰。\nGrok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟，但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是，grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。\nOpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时，比GPT-Realtime-2.1的10.75/小时便宜六成，但比Grok Voice贵了近一倍。\n单独看每分钟几美分的价差微不足道。换算成商业场景：一个月10万分钟通话量（对大型客服中心而言并不罕见），Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互，价差将以百万美元计。\n但真正透露战略野心的，是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式，不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符，比OpenAI的约30低86%，比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略，只有在马斯克手中同时掌握特斯拉（终端）、Starlink（网络）和X（数据与分发）时才有商业合理性。语音API可以薄利甚至亏损，生态内的其他环节会加倍赚回来。\n这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑，与当年AWS碾压传统IDC如出一辙。\n特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱，它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力，每一次对话既是一次A/B测试，也是一条训练数据。\n车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据，全球车载语音助手市场2025年约为84亿美元，预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作，计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断，在自动驾驶逐步解放双手之后，语音将成为座舱的主交互通道。\n穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框；Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商，但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定，这本身就说明了一个事实，硬件厂商没有忠诚度，只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势，硬件厂商的切换只是时间问题。\n中国阵营，谁是主力？\n国内实时语音的竞争格局，远比一两家公司撑起来的场面要热闹。\n阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道，国内至少还有五家公司在同一方向上投入了实质性力量。\n字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构，已在超过700万辆量产车上落地，覆盖50多个汽车品牌。2026年4月，Seeduplex完成了新一轮升级，通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆，既有自研模型，又有抖音和火山引擎的庞大分发网络。\nMiniMax走的是另一条路：扎根语音基础设施，把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下，支持40多种语言，已被LiveKit（ChatGPT高级语音模式的技术栈）、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧，Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确：不跟OpenAI和SpaceXAI在通用大模型上正面拼，而在语音这个垂直层做到“谁的管道里都有我”。\n科大讯飞是语音领域的资深玩家，在国内市场的根基远比其他几家深厚。据IDC数据，讯飞在语音语义市场的份额为15.6%，位居第一。2026年2月发布的星火X2大模型基于全国产算力训练，6月集中发布了四款企业级AI应用，将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上，而在垂直场景的深度渗透：教育口语测评、医疗语音病历、政务热线智能坐席、车载语音，每一块都是需要行业know-how的硬骨头。\n百度在语音大模型上的投入也值得留意。2026年1月，百度发布了业界首个基于Cross-Attention的端到端语音语言大模型，响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次，依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络（比亚迪、吉利等12家车企搭载了小度车载系统），在“模型加终端”的维度上，百度是国内极少数能与字节对标的企业。\n智谱AI的GLM-4-Voice于2024年10月上线，是国内最早一批端到端语音大模型之一，在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音（98%准确率、方言识别提升30%）、腾讯视频的角色扮演语音通话等产品矩阵，把语音AI嵌入已有的超级App生态中。\n这六家中国公司加上阿里云，构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同，但在一个方向上高度重合：车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手，但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间，天壤之别。\n三个信号\n实时语音Agent的战局给出了三个清晰信号。\n速度即护城河。在文本大模型领域，一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中，100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先，但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒，这不只是快慢之分，是能用与不能用的区别。\n这个物理天花板指向一个清楚的终局，端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面：速度不是唯一标准，在需要深度推理和可靠执行的场景中，“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利，而是端到端、轮次制和混合路由各自占据不同场景的生态位。\n硬件决定终局。纯API模型公司正在面对一个现实，没有自有硬件终端，语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作，凡是拥有硬件出口的公司，在语音入口争夺中天然多一条命。\nOpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域，将在下一阶段处于被动。中国市场正以另一套武器打同一场仗，讯飞、字节、百度、阿里在车企供应链中的位置之战，复刻着同一逻辑。语音入口的竞争，说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型，迁移成本也会使替换变得不划算。一旦被设为默认，换掉它的交易成本就高到让多数人选择忍受。\n定价只是起点。Grok TTS定价比ElevenLabs低90%，Llama-Voice开源免费，MiniMax以250毫秒延迟服务全球平台，语音基础设施的价格正在被全面压平，但这只是表层。SpaceXAI靠生态反哺（特斯拉、Starlink、X），Meta靠开源铺设分发管道，微软靠平台锁定企业客户，亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式，真正的利润在生态的其他环节。\n对于开发者和硬件厂商，此刻需要做一个关键决策：绑定单一模型，还是多模型冗余？前者的成本最低但锁定风险最高；后者的延迟和体验优化复杂度将成倍增加。无论走哪条路，都不能再用“等一等再看”的心态观望。语音入口的窗口期，不会超过18个月。\n语音不是大模型的附加功能，它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下，比API合同难解除得多。（本文首发钛媒体APP，作者 | AGI-Signal，编辑 | 秦聪慧）","excerpt":"全球语音大模型，角逐方向盘后的麦克风\n语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。\n7月，实时语音Agent战场上连爆多颗信号弹。\n7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。\n7月28日，阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录，登顶全球语音推理排行榜，但它的平均首音延迟高达4.02秒。7月29日，SpaceXAI（原xAI）发布Grok Voice Think Fast 2.0，首音延迟压到0.70秒，Big Bench Audio得分97.2%，在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先，GPT-Realtime-2.1 High是45.7%，Gemini 3.1 Flash High是37.7%。更早一些，7月6日，OpenAI也发布了GPT-Realtime-2.1。\nSpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦，而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。\n一场“毫秒级”军备竞赛\n过去半年，实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上：首音延迟、语音识别精度、调用成本。\n先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒，从用户说完话到AI开口，在大多数人尚未察觉的间隙就已完成了应答。作为对比，v1.0的TTFA是1.25秒，GPT-Realtime-2高推理模式是2.33秒，Gemini 3.1 Flash High是2.98秒，Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中，Grok TTS的流式模式首音延迟已压到285毫秒，标准模式460毫秒。2.0在此基础上进一步优化了推理效率：推理token减少60%，工具调用可以在用户说完第一句话之前就开始执行。\nxAI从一开始就把语音管线做成了一体化，自研语音活动检测、自研音频分词器、自研端到端语音模型，传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释：每绕过一层中间件，就省掉一层延迟和一层错误概率。\n在Artificial Analysis的综合语音质量指数上，Think Fast 2.0总评分82.9%，较v1.0的75.7%提升9.5%，超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%；Full Duplex Bench从77.8%跳升至95.1%，逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计，10倍于上一代，远超专业转录模型的水平。\n但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录，超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景：Flash面向实时交互（首包延迟300毫秒级）、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中，4秒意味着不可用。\n这个矛盾暴露了当前技术竞赛中一个绕不开的取舍：追求极致推理精度的模型，往往在延迟上买单，Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域，延迟是物理天花板，0.5秒以内的延迟让人感觉“在对话”，1.5秒左右就变成了“在等机器人”，到4秒，用户只会觉得“这功能坏了”。\nOpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后，旗舰模型音频输入32/百万token、输出64/百万token，mini版10和20。理论折算约0.05/分钟，独立开发者实测的数据则迅速偏离理论值，一个房产导览AI的实际均价约0.07/分钟，最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀，是OpenAI语音模型商业化绕不开的难题。\nGoogle Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉，某些模型版本从500毫秒增至1800毫秒，甚至10秒以上的等待，暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商，这种不稳定性比“慢”更致命。\n如果再把镜头拉远一点，比七月更早落子的还有两个重量级玩家。\n微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口，开发者不需要自己拼接语音管线。更关键的是微软的双重身份：它既是GPT-Realtime-2.1的云平台宿主（企业客户通过Azure调用OpenAI模型），又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通，支持WebSocket和WebRTC低延迟连接，直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线，客户一旦把语音Agent跑在Azure上，迁移成本远比切换一个API端点高得多。\nMeta则在开源侧投下了一枚重弹。4月，Meta以Apache 2.0协议开源了Llama-Voice，一个7B参数的TTS基础模型，支持52种语言，10秒音频即可零样本声音克隆，能在消费级GPU上实时运行。上线48小时下载量突破80万，社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2，支持100多种语言的实时语音翻译，延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端，Meta拥有从开源模型到消费硬件的完整通路，OpenAI恰好缺这一块。\n端到端、混合路由、轮次制、拼积木\nSpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下，但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊，至少能看到四种截然不同的技术选择。\n最激进的是Grok Voice的原生端到端路线。音频输入、音频输出，全由一个模型完成。这套架构最大胆的一点，是它在WebSocket连接中直接处理原始音频信号，不经过ASR转文本，也不经过TTS合成。60%的推理token压缩从侧面印证了这一点，2.0不需要把用户说的每句话都拆成详细文本再推理，模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%，而ElevenLabs为12.0%、Deepgram为13.5%。\n相比之下，OpenAI的Realtime API虽然标称支持端到端，在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费，上下文越长越贵，缓存机制（0.40/百万输入token旗舰版）只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着，用户的每一轮追问都在悄悄抬高账单。\nAnthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。\nAnthropic选择轮次制（listen→think→speak）而非全双工，以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞，同时连接Gmail、Calendar、Slack等应用，每一步操作前都要求用户确认，核心逻辑是语音不只是一个交互界面，它应该能推动真实的工作流程。代价是交互节奏不如全双工自然，但在需要深思熟虑的场景中，轮次制的深度优于全双工的流畅。\n亚马逊走多模型路由，通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理，各司其职。6亿台Echo终端是Alexa的基本盘，但7月升级释放了更重要的信号，Alexa+已经跨出硬件，进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目，投入超过1亿美元GPU算力，目标是实现多任务联动交互，但高昂成本已在内部引发争议。\n这两家的共同判断是“不为全双工牺牲其他能力”，在大多数生产力场景中，用户要的是一个靠谱的结果，而不是一个能随时插话的聊天对象。\n而在光谱的另一端，Deepgram和AssemblyAI代表的传统语音专业厂商，仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%，低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的，每增加一个中间环节，就多一层延迟。对于车载和穿戴场景，传统流水线的天花板约在600至1500毫秒，而端到端方案已经下探到了300毫秒以下。\n这四种路线之外，还有一个不可忽视的变量正在浮现：端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行，都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束，待高通、苹果和车企定制芯片的迭代完成后，端侧语音推理有可能在2027至2028年进入主流量产。届时，云端语音API的商业模式将面临根本性挑战。\n当屏幕不再是默认界面\n从定价策略来看，SpaceXAI的战略意图很清晰。\nGrok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟，但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是，grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。\nOpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时，比GPT-Realtime-2.1的10.75/小时便宜六成，但比Grok Voice贵了近一倍。\n单独看每分钟几美分的价差微不足道。换算成商业场景：一个月10万分钟通话量（对大型客服中心而言并不罕见），Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互，价差将以百万美元计。\n但真正透露战略野心的，是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式，不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符，比OpenAI的约30低86%，比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略，只有在马斯克手中同时掌握特斯拉（终端）、Starlink（网络）和X（数据与分发）时才有商业合理性。语音API可以薄利甚至亏损，生态内的其他环节会加倍赚回来。\n这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑，与当年AWS碾压传统IDC如出一辙。\n特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱，它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力，每一次对话既是一次A/B测试，也是一条训练数据。\n车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据，全球车载语音助手市场2025年约为84亿美元，预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作，计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断，在自动驾驶逐步解放双手之后，语音将成为座舱的主交互通道。\n穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框；Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商，但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定，这本身就说明了一个事实，硬件厂商没有忠诚度，只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势，硬件厂商的切换只是时间问题。\n中国阵营，谁是主力？\n国内实时语音的竞争格局，远比一两家公司撑起来的场面要热闹。\n阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道，国内至少还有五家公司在同一方向上投入了实质性力量。\n字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构，已在超过700万辆量产车上落地，覆盖50多个汽车品牌。2026年4月，Seeduplex完成了新一轮升级，通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆，既有自研模型，又有抖音和火山引擎的庞大分发网络。\nMiniMax走的是另一条路：扎根语音基础设施，把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下，支持40多种语言，已被LiveKit（ChatGPT高级语音模式的技术栈）、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧，Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确：不跟OpenAI和SpaceXAI在通用大模型上正面拼，而在语音这个垂直层做到“谁的管道里都有我”。\n科大讯飞是语音领域的资深玩家，在国内市场的根基远比其他几家深厚。据IDC数据，讯飞在语音语义市场的份额为15.6%，位居第一。2026年2月发布的星火X2大模型基于全国产算力训练，6月集中发布了四款企业级AI应用，将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上，而在垂直场景的深度渗透：教育口语测评、医疗语音病历、政务热线智能坐席、车载语音，每一块都是需要行业know-how的硬骨头。\n百度在语音大模型上的投入也值得留意。2026年1月，百度发布了业界首个基于Cross-Attention的端到端语音语言大模型，响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次，依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络（比亚迪、吉利等12家车企搭载了小度车载系统），在“模型加终端”的维度上，百度是国内极少数能与字节对标的企业。\n智谱AI的GLM-4-Voice于2024年10月上线，是国内最早一批端到端语音大模型之一，在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音（98%准确率、方言识别提升30%）、腾讯视频的角色扮演语音通话等产品矩阵，把语音AI嵌入已有的超级App生态中。\n这六家中国公司加上阿里云，构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同，但在一个方向上高度重合：车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手，但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间，天壤之别。\n三个信号\n实时语音Agent的战局给出了三个清晰信号。\n速度即护城河。在文本大模型领域，一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中，100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先，但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒，这不只是快慢之分，是能用与不能用的区别。\n这个物理天花板指向一个清楚的终局，端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面：速度不是唯一标准，在需要深度推理和可靠执行的场景中，“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利，而是端到端、轮次制和混合路由各自占据不同场景的生态位。\n硬件决定终局。纯API模型公司正在面对一个现实，没有自有硬件终端，语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作，凡是拥有硬件出口的公司，在语音入口争夺中天然多一条命。\nOpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域，将在下一阶段处于被动。中国市场正以另一套武器打同一场仗，讯飞、字节、百度、阿里在车企供应链中的位置之战，复刻着同一逻辑。语音入口的竞争，说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型，迁移成本也会使替换变得不划算。一旦被设为默认，换掉它的交易成本就高到让多数人选择忍受。\n定价只是起点。Grok TTS定价比ElevenLabs低90%，Llama-Voice开源免费，MiniMax以250毫秒延迟服务全球平台，语音基础设施的价格正在被全面压平，但这只是表层。SpaceXAI靠生态反哺（特斯拉、Starlink、X），Meta靠开源铺设分发管道，微软靠平台锁定企业客户，亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式，真正的利润在生态的其他环节。\n对于开发者和硬件厂商，此刻需要做一个关键决策：绑定单一模型，还是多模型冗余？前者的成本最低但锁定风险最高；后者的延迟和体验优化复杂度将成倍增加。无论走哪条路，都不能再用“等一等再看”的心态观望。语音入口的窗口期，不会超过18个月。\n语音不是大模型的附加功能，它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下，比API合同难解除得多。（本文首发钛媒体APP，作者 | AGI-Signal，编辑 | 秦聪慧）","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 8192 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1057823678_116132%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 8192 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":8192,"summary_length":8192,"usable_text_length":8192,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":8192,"summary_length":8192}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"全球语音大模型，角逐方向盘后的麦克风 - Sohu","url":"https://m.sohu.com/a/1057823678_116132?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"全球语音大模型，角逐方向盘后的麦克风\n语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。\n7月，实时语音Agent战场上连爆多颗信号弹。\n7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。\n7月28日，阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录，登顶全球语音推理排行榜，但它的平均首音延迟高达4.02秒。7月29日，SpaceXAI（原xAI）发布Grok Voice Think Fast 2.0，首音延迟压到0.70秒，Big Bench Audio得分97.2%，在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先，GPT-Realtime-2.1 High是45.7%，Gemini 3.1 Flash High是37.7%。更早一些，7月6日，OpenAI也发布了GPT-Realtime-2.1。\nSpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦，而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。\n一场“毫秒级”军备竞赛\n过去半年，实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上：首音延迟、语音识别精度、调用成本。\n先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒，从用户说完话到AI开口，在大多数人尚未察觉的间隙就已完成了应答。作为对比，v1.0的TTFA是1.25秒，GPT-Realtime-2高推理模式是2.33秒，Gemini 3.1 Flash High是2.98秒，Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中，Grok TTS的流式模式首音延迟已压到285毫秒，标准模式460毫秒。2.0在此基础上进一步优化了推理效率：推理token减少60%，工具调用可以在用户说完第一句话之前就开始执行。\nxAI从一开始就把语音管线做成了一体化，自研语音活动检测、自研音频分词器、自研端到端语音模型，传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释：每绕过一层中间件，就省掉一层延迟和一层错误概率。\n在Artificial Analysis的综合语音质量指数上，Think Fast 2.0总评分82.9%，较v1.0的75.7%提升9.5%，超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%；Full Duplex Bench从77.8%跳升至95.1%，逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计，10倍于上一代，远超专业转录模型的水平。\n但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录，超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景：Flash面向实时交互（首包延迟300毫秒级）、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中，4秒意味着不可用。\n这个矛盾暴露了当前技术竞赛中一个绕不开的取舍：追求极致推理精度的模型，往往在延迟上买单，Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域，延迟是物理天花板，0.5秒以内的延迟让人感觉“在对话”，1.5秒左右就变成了“在等机器人”，到4秒，用户只会觉得“这功能坏了”。\nOpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后，旗舰模型音频输入32/百万token、输出64/百万token，mini版10和20。理论折算约0.05/分钟，独立开发者实测的数据则迅速偏离理论值，一个房产导览AI的实际均价约0.07/分钟，最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀，是OpenAI语音模型商业化绕不开的难题。\nGoogle Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉，某些模型版本从500毫秒增至1800毫秒，甚至10秒以上的等待，暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商，这种不稳定性比“慢”更致命。\n如果再把镜头拉远一点，比七月更早落子的还有两个重量级玩家。\n微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口，开发者不需要自己拼接语音管线。更关键的是微软的双重身份：它既是GPT-Realtime-2.1的云平台宿主（企业客户通过Azure调用OpenAI模型），又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通，支持WebSocket和WebRTC低延迟连接，直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线，客户一旦把语音Agent跑在Azure上，迁移成本远比切换一个API端点高得多。\nMeta则在开源侧投下了一枚重弹。4月，Meta以Apache 2.0协议开源了Llama-Voice，一个7B参数的TTS基础模型，支持52种语言，10秒音频即可零样本声音克隆，能在消费级GPU上实时运行。上线48小时下载量突破80万，社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2，支持100多种语言的实时语音翻译，延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端，Meta拥有从开源模型到消费硬件的完整通路，OpenAI恰好缺这一块。\n端到端、混合路由、轮次制、拼积木\nSpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下，但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊，至少能看到四种截然不同的技术选择。\n最激进的是Grok Voice的原生端到端路线。音频输入、音频输出，全由一个模型完成。这套架构最大胆的一点，是它在WebSocket连接中直接处理原始音频信号，不经过ASR转文本，也不经过TTS合成。60%的推理token压缩从侧面印证了这一点，2.0不需要把用户说的每句话都拆成详细文本再推理，模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%，而ElevenLabs为12.0%、Deepgram为13.5%。\n相比之下，OpenAI的Realtime API虽然标称支持端到端，在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费，上下文越长越贵，缓存机制（0.40/百万输入token旗舰版）只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着，用户的每一轮追问都在悄悄抬高账单。\nAnthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。\nAnthropic选择轮次制（listen→think→speak）而非全双工，以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞，同时连接Gmail、Calendar、Slack等应用，每一步操作前都要求用户确认，核心逻辑是语音不只是一个交互界面，它应该能推动真实的工作流程。代价是交互节奏不如全双工自然，但在需要深思熟虑的场景中，轮次制的深度优于全双工的流畅。\n亚马逊走多模型路由，通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理，各司其职。6亿台Echo终端是Alexa的基本盘，但7月升级释放了更重要的信号，Alexa+已经跨出硬件，进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目，投入超过1亿美元GPU算力，目标是实现多任务联动交互，但高昂成本已在内部引发争议。\n这两家的共同判断是“不为全双工牺牲其他能力”，在大多数生产力场景中，用户要的是一个靠谱的结果，而不是一个能随时插话的聊天对象。\n而在光谱的另一端，Deepgram和AssemblyAI代表的传统语音专业厂商，仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%，低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的，每增加一个中间环节，就多一层延迟。对于车载和穿戴场景，传统流水线的天花板约在600至1500毫秒，而端到端方案已经下探到了300毫秒以下。\n这四种路线之外，还有一个不可忽视的变量正在浮现：端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行，都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束，待高通、苹果和车企定制芯片的迭代完成后，端侧语音推理有可能在2027至2028年进入主流量产。届时，云端语音API的商业模式将面临根本性挑战。\n当屏幕不再是默认界面\n从定价策略来看，SpaceXAI的战略意图很清晰。\nGrok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟，但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是，grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。\nOpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时，比GPT-Realtime-2.1的10.75/小时便宜六成，但比Grok Voice贵了近一倍。\n单独看每分钟几美分的价差微不足道。换算成商业场景：一个月10万分钟通话量（对大型客服中心而言并不罕见），Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互，价差将以百万美元计。\n但真正透露战略野心的，是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式，不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符，比OpenAI的约30低86%，比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略，只有在马斯克手中同时掌握特斯拉（终端）、Starlink（网络）和X（数据与分发）时才有商业合理性。语音API可以薄利甚至亏损，生态内的其他环节会加倍赚回来。\n这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑，与当年AWS碾压传统IDC如出一辙。\n特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱，它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力，每一次对话既是一次A/B测试，也是一条训练数据。\n车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据，全球车载语音助手市场2025年约为84亿美元，预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作，计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断，在自动驾驶逐步解放双手之后，语音将成为座舱的主交互通道。\n穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框；Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商，但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定，这本身就说明了一个事实，硬件厂商没有忠诚度，只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势，硬件厂商的切换只是时间问题。\n中国阵营，谁是主力？\n国内实时语音的竞争格局，远比一两家公司撑起来的场面要热闹。\n阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道，国内至少还有五家公司在同一方向上投入了实质性力量。\n字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构，已在超过700万辆量产车上落地，覆盖50多个汽车品牌。2026年4月，Seeduplex完成了新一轮升级，通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆，既有自研模型，又有抖音和火山引擎的庞大分发网络。\nMiniMax走的是另一条路：扎根语音基础设施，把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下，支持40多种语言，已被LiveKit（ChatGPT高级语音模式的技术栈）、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧，Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确：不跟OpenAI和SpaceXAI在通用大模型上正面拼，而在语音这个垂直层做到“谁的管道里都有我”。\n科大讯飞是语音领域的资深玩家，在国内市场的根基远比其他几家深厚。据IDC数据，讯飞在语音语义市场的份额为15.6%，位居第一。2026年2月发布的星火X2大模型基于全国产算力训练，6月集中发布了四款企业级AI应用，将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上，而在垂直场景的深度渗透：教育口语测评、医疗语音病历、政务热线智能坐席、车载语音，每一块都是需要行业know-how的硬骨头。\n百度在语音大模型上的投入也值得留意。2026年1月，百度发布了业界首个基于Cross-Attention的端到端语音语言大模型，响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次，依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络（比亚迪、吉利等12家车企搭载了小度车载系统），在“模型加终端”的维度上，百度是国内极少数能与字节对标的企业。\n智谱AI的GLM-4-Voice于2024年10月上线，是国内最早一批端到端语音大模型之一，在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音（98%准确率、方言识别提升30%）、腾讯视频的角色扮演语音通话等产品矩阵，把语音AI嵌入已有的超级App生态中。\n这六家中国公司加上阿里云，构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同，但在一个方向上高度重合：车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手，但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间，天壤之别。\n三个信号\n实时语音Agent的战局给出了三个清晰信号。\n速度即护城河。在文本大模型领域，一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中，100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先，但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒，这不只是快慢之分，是能用与不能用的区别。\n这个物理天花板指向一个清楚的终局，端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面：速度不是唯一标准，在需要深度推理和可靠执行的场景中，“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利，而是端到端、轮次制和混合路由各自占据不同场景的生态位。\n硬件决定终局。纯API模型公司正在面对一个现实，没有自有硬件终端，语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作，凡是拥有硬件出口的公司，在语音入口争夺中天然多一条命。\nOpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域，将在下一阶段处于被动。中国市场正以另一套武器打同一场仗，讯飞、字节、百度、阿里在车企供应链中的位置之战，复刻着同一逻辑。语音入口的竞争，说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型，迁移成本也会使替换变得不划算。一旦被设为默认，换掉它的交易成本就高到让多数人选择忍受。\n定价只是起点。Grok TTS定价比ElevenLabs低90%，Llama-Voice开源免费，MiniMax以250毫秒延迟服务全球平台，语音基础设施的价格正在被全面压平，但这只是表层。SpaceXAI靠生态反哺（特斯拉、Starlink、X），Meta靠开源铺设分发管道，微软靠平台锁定企业客户，亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式，真正的利润在生态的其他环节。\n对于开发者和硬件厂商，此刻需要做一个关键决策：绑定单一模型，还是多模型冗余？前者的成本最低但锁定风险最高；后者的延迟和体验优化复杂度将成倍增加。无论走哪条路，都不能再用“等一等再看”的心态观望。语音入口的窗口期，不会超过18个月。\n语音不是大模型的附加功能，它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下，比API合同难解除得多。（本文首发钛媒体APP，作者 | AGI-Signal，编辑 | 秦聪慧）","source":"Sohu","date":"2026-08-02T04:45:33+00:00","content":"全球语音大模型，角逐方向盘后的麦克风\n语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。\n7月，实时语音Agent战场上连爆多颗信号弹。\n7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。\n7月28日，阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录，登顶全球语音推理排行榜，但它的平均首音延迟高达4.02秒。7月29日，SpaceXAI（原xAI）发布Grok Voice Think Fast 2.0，首音延迟压到0.70秒，Big Bench Audio得分97.2%，在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先，GPT-Realtime-2.1 High是45.7%，Gemini 3.1 Flash High是37.7%。更早一些，7月6日，OpenAI也发布了GPT-Realtime-2.1。\nSpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦，而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。\n一场“毫秒级”军备竞赛\n过去半年，实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上：首音延迟、语音识别精度、调用成本。\n先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒，从用户说完话到AI开口，在大多数人尚未察觉的间隙就已完成了应答。作为对比，v1.0的TTFA是1.25秒，GPT-Realtime-2高推理模式是2.33秒，Gemini 3.1 Flash High是2.98秒，Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中，Grok TTS的流式模式首音延迟已压到285毫秒，标准模式460毫秒。2.0在此基础上进一步优化了推理效率：推理token减少60%，工具调用可以在用户说完第一句话之前就开始执行。\nxAI从一开始就把语音管线做成了一体化，自研语音活动检测、自研音频分词器、自研端到端语音模型，传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释：每绕过一层中间件，就省掉一层延迟和一层错误概率。\n在Artificial Analysis的综合语音质量指数上，Think Fast 2.0总评分82.9%，较v1.0的75.7%提升9.5%，超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%；Full Duplex Bench从77.8%跳升至95.1%，逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计，10倍于上一代，远超专业转录模型的水平。\n但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录，超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景：Flash面向实时交互（首包延迟300毫秒级）、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中，4秒意味着不可用。\n这个矛盾暴露了当前技术竞赛中一个绕不开的取舍：追求极致推理精度的模型，往往在延迟上买单，Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域，延迟是物理天花板，0.5秒以内的延迟让人感觉“在对话”，1.5秒左右就变成了“在等机器人”，到4秒，用户只会觉得“这功能坏了”。\nOpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后，旗舰模型音频输入32/百万token、输出64/百万token，mini版10和20。理论折算约0.05/分钟，独立开发者实测的数据则迅速偏离理论值，一个房产导览AI的实际均价约0.07/分钟，最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀，是OpenAI语音模型商业化绕不开的难题。\nGoogle Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉，某些模型版本从500毫秒增至1800毫秒，甚至10秒以上的等待，暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商，这种不稳定性比“慢”更致命。\n如果再把镜头拉远一点，比七月更早落子的还有两个重量级玩家。\n微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口，开发者不需要自己拼接语音管线。更关键的是微软的双重身份：它既是GPT-Realtime-2.1的云平台宿主（企业客户通过Azure调用OpenAI模型），又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通，支持WebSocket和WebRTC低延迟连接，直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线，客户一旦把语音Agent跑在Azure上，迁移成本远比切换一个API端点高得多。\nMeta则在开源侧投下了一枚重弹。4月，Meta以Apache 2.0协议开源了Llama-Voice，一个7B参数的TTS基础模型，支持52种语言，10秒音频即可零样本声音克隆，能在消费级GPU上实时运行。上线48小时下载量突破80万，社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2，支持100多种语言的实时语音翻译，延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端，Meta拥有从开源模型到消费硬件的完整通路，OpenAI恰好缺这一块。\n端到端、混合路由、轮次制、拼积木\nSpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下，但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊，至少能看到四种截然不同的技术选择。\n最激进的是Grok Voice的原生端到端路线。音频输入、音频输出，全由一个模型完成。这套架构最大胆的一点，是它在WebSocket连接中直接处理原始音频信号，不经过ASR转文本，也不经过TTS合成。60%的推理token压缩从侧面印证了这一点，2.0不需要把用户说的每句话都拆成详细文本再推理，模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%，而ElevenLabs为12.0%、Deepgram为13.5%。\n相比之下，OpenAI的Realtime API虽然标称支持端到端，在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费，上下文越长越贵，缓存机制（0.40/百万输入token旗舰版）只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着，用户的每一轮追问都在悄悄抬高账单。\nAnthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。\nAnthropic选择轮次制（listen→think→speak）而非全双工，以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞，同时连接Gmail、Calendar、Slack等应用，每一步操作前都要求用户确认，核心逻辑是语音不只是一个交互界面，它应该能推动真实的工作流程。代价是交互节奏不如全双工自然，但在需要深思熟虑的场景中，轮次制的深度优于全双工的流畅。\n亚马逊走多模型路由，通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理，各司其职。6亿台Echo终端是Alexa的基本盘，但7月升级释放了更重要的信号，Alexa+已经跨出硬件，进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目，投入超过1亿美元GPU算力，目标是实现多任务联动交互，但高昂成本已在内部引发争议。\n这两家的共同判断是“不为全双工牺牲其他能力”，在大多数生产力场景中，用户要的是一个靠谱的结果，而不是一个能随时插话的聊天对象。\n而在光谱的另一端，Deepgram和AssemblyAI代表的传统语音专业厂商，仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%，低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的，每增加一个中间环节，就多一层延迟。对于车载和穿戴场景，传统流水线的天花板约在600至1500毫秒，而端到端方案已经下探到了300毫秒以下。\n这四种路线之外，还有一个不可忽视的变量正在浮现：端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行，都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束，待高通、苹果和车企定制芯片的迭代完成后，端侧语音推理有可能在2027至2028年进入主流量产。届时，云端语音API的商业模式将面临根本性挑战。\n当屏幕不再是默认界面\n从定价策略来看，SpaceXAI的战略意图很清晰。\nGrok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟，但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是，grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。\nOpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时，比GPT-Realtime-2.1的10.75/小时便宜六成，但比Grok Voice贵了近一倍。\n单独看每分钟几美分的价差微不足道。换算成商业场景：一个月10万分钟通话量（对大型客服中心而言并不罕见），Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互，价差将以百万美元计。\n但真正透露战略野心的，是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式，不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符，比OpenAI的约30低86%，比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略，只有在马斯克手中同时掌握特斯拉（终端）、Starlink（网络）和X（数据与分发）时才有商业合理性。语音API可以薄利甚至亏损，生态内的其他环节会加倍赚回来。\n这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑，与当年AWS碾压传统IDC如出一辙。\n特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱，它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力，每一次对话既是一次A/B测试，也是一条训练数据。\n车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据，全球车载语音助手市场2025年约为84亿美元，预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作，计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断，在自动驾驶逐步解放双手之后，语音将成为座舱的主交互通道。\n穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框；Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商，但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定，这本身就说明了一个事实，硬件厂商没有忠诚度，只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势，硬件厂商的切换只是时间问题。\n中国阵营，谁是主力？\n国内实时语音的竞争格局，远比一两家公司撑起来的场面要热闹。\n阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道，国内至少还有五家公司在同一方向上投入了实质性力量。\n字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构，已在超过700万辆量产车上落地，覆盖50多个汽车品牌。2026年4月，Seeduplex完成了新一轮升级，通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆，既有自研模型，又有抖音和火山引擎的庞大分发网络。\nMiniMax走的是另一条路：扎根语音基础设施，把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下，支持40多种语言，已被LiveKit（ChatGPT高级语音模式的技术栈）、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧，Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确：不跟OpenAI和SpaceXAI在通用大模型上正面拼，而在语音这个垂直层做到“谁的管道里都有我”。\n科大讯飞是语音领域的资深玩家，在国内市场的根基远比其他几家深厚。据IDC数据，讯飞在语音语义市场的份额为15.6%，位居第一。2026年2月发布的星火X2大模型基于全国产算力训练，6月集中发布了四款企业级AI应用，将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上，而在垂直场景的深度渗透：教育口语测评、医疗语音病历、政务热线智能坐席、车载语音，每一块都是需要行业know-how的硬骨头。\n百度在语音大模型上的投入也值得留意。2026年1月，百度发布了业界首个基于Cross-Attention的端到端语音语言大模型，响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次，依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络（比亚迪、吉利等12家车企搭载了小度车载系统），在“模型加终端”的维度上，百度是国内极少数能与字节对标的企业。\n智谱AI的GLM-4-Voice于2024年10月上线，是国内最早一批端到端语音大模型之一，在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音（98%准确率、方言识别提升30%）、腾讯视频的角色扮演语音通话等产品矩阵，把语音AI嵌入已有的超级App生态中。\n这六家中国公司加上阿里云，构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同，但在一个方向上高度重合：车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手，但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间，天壤之别。\n三个信号\n实时语音Agent的战局给出了三个清晰信号。\n速度即护城河。在文本大模型领域，一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中，100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先，但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒，这不只是快慢之分，是能用与不能用的区别。\n这个物理天花板指向一个清楚的终局，端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面：速度不是唯一标准，在需要深度推理和可靠执行的场景中，“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利，而是端到端、轮次制和混合路由各自占据不同场景的生态位。\n硬件决定终局。纯API模型公司正在面对一个现实，没有自有硬件终端，语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作，凡是拥有硬件出口的公司，在语音入口争夺中天然多一条命。\nOpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域，将在下一阶段处于被动。中国市场正以另一套武器打同一场仗，讯飞、字节、百度、阿里在车企供应链中的位置之战，复刻着同一逻辑。语音入口的竞争，说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型，迁移成本也会使替换变得不划算。一旦被设为默认，换掉它的交易成本就高到让多数人选择忍受。\n定价只是起点。Grok TTS定价比ElevenLabs低90%，Llama-Voice开源免费，MiniMax以250毫秒延迟服务全球平台，语音基础设施的价格正在被全面压平，但这只是表层。SpaceXAI靠生态反哺（特斯拉、Starlink、X），Meta靠开源铺设分发管道，微软靠平台锁定企业客户，亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式，真正的利润在生态的其他环节。\n对于开发者和硬件厂商，此刻需要做一个关键决策：绑定单一模型，还是多模型冗余？前者的成本最低但锁定风险最高；后者的延迟和体验优化复杂度将成倍增加。无论走哪条路，都不能再用“等一等再看”的心态观望。语音入口的窗口期，不会超过18个月。\n语音不是大模型的附加功能，它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下，比API合同难解除得多。（本文首发钛媒体APP，作者 | AGI-Signal，编辑 | 秦聪慧）","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1057823678_116132%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 8192 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 8192 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":8192,"summary_length":8192,"usable_text_length":8192,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":8192,"summary_length":8192}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/51481","export_markdown":"/api/items/51481/export?format=markdown","export_json":"/api/items/51481/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1057823678_116132%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"formats":{"full":{"id":51481,"title":"全球语音大模型，角逐方向盘后的麦克风 - Sohu","url":"https://m.sohu.com/a/1057823678_116132?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"Sohu","author":null,"published_at":"2026-08-02T04:45:33+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"全球语音大模型，角逐方向盘后的麦克风\n语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。\n7月，实时语音Agent战场上连爆多颗信号弹。\n7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。\n7月28日，阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录，登顶全球语音推理排行榜，但它的平均首音延迟高达4.02秒。7月29日，SpaceXAI（原xAI）发布Grok Voice Think Fast 2.0，首音延迟压到0.70秒，Big Bench Audio得分97.2%，在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先，GPT-Realtime-2.1 High是45.7%，Gemini 3.1 Flash High是37.7%。更早一些，7月6日，OpenAI也发布了GPT-Realtime-2.1。\nSpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦，而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。\n一场“毫秒级”军备竞赛\n过去半年，实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上：首音延迟、语音识别精度、调用成本。\n先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒，从用户说完话到AI开口，在大多数人尚未察觉的间隙就已完成了应答。作为对比，v1.0的TTFA是1.25秒，GPT-Realtime-2高推理模式是2.33秒，Gemini 3.1 Flash High是2.98秒，Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中，Grok TTS的流式模式首音延迟已压到285毫秒，标准模式460毫秒。2.0在此基础上进一步优化了推理效率：推理token减少60%，工具调用可以在用户说完第一句话之前就开始执行。\nxAI从一开始就把语音管线做成了一体化，自研语音活动检测、自研音频分词器、自研端到端语音模型，传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释：每绕过一层中间件，就省掉一层延迟和一层错误概率。\n在Artificial Analysis的综合语音质量指数上，Think Fast 2.0总评分82.9%，较v1.0的75.7%提升9.5%，超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%；Full Duplex Bench从77.8%跳升至95.1%，逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计，10倍于上一代，远超专业转录模型的水平。\n但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录，超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景：Flash面向实时交互（首包延迟300毫秒级）、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中，4秒意味着不可用。\n这个矛盾暴露了当前技术竞赛中一个绕不开的取舍：追求极致推理精度的模型，往往在延迟上买单，Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域，延迟是物理天花板，0.5秒以内的延迟让人感觉“在对话”，1.5秒左右就变成了“在等机器人”，到4秒，用户只会觉得“这功能坏了”。\nOpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后，旗舰模型音频输入32/百万token、输出64/百万token，mini版10和20。理论折算约0.05/分钟，独立开发者实测的数据则迅速偏离理论值，一个房产导览AI的实际均价约0.07/分钟，最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀，是OpenAI语音模型商业化绕不开的难题。\nGoogle Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉，某些模型版本从500毫秒增至1800毫秒，甚至10秒以上的等待，暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商，这种不稳定性比“慢”更致命。\n如果再把镜头拉远一点，比七月更早落子的还有两个重量级玩家。\n微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口，开发者不需要自己拼接语音管线。更关键的是微软的双重身份：它既是GPT-Realtime-2.1的云平台宿主（企业客户通过Azure调用OpenAI模型），又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通，支持WebSocket和WebRTC低延迟连接，直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线，客户一旦把语音Agent跑在Azure上，迁移成本远比切换一个API端点高得多。\nMeta则在开源侧投下了一枚重弹。4月，Meta以Apache 2.0协议开源了Llama-Voice，一个7B参数的TTS基础模型，支持52种语言，10秒音频即可零样本声音克隆，能在消费级GPU上实时运行。上线48小时下载量突破80万，社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2，支持100多种语言的实时语音翻译，延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端，Meta拥有从开源模型到消费硬件的完整通路，OpenAI恰好缺这一块。\n端到端、混合路由、轮次制、拼积木\nSpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下，但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊，至少能看到四种截然不同的技术选择。\n最激进的是Grok Voice的原生端到端路线。音频输入、音频输出，全由一个模型完成。这套架构最大胆的一点，是它在WebSocket连接中直接处理原始音频信号，不经过ASR转文本，也不经过TTS合成。60%的推理token压缩从侧面印证了这一点，2.0不需要把用户说的每句话都拆成详细文本再推理，模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%，而ElevenLabs为12.0%、Deepgram为13.5%。\n相比之下，OpenAI的Realtime API虽然标称支持端到端，在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费，上下文越长越贵，缓存机制（0.40/百万输入token旗舰版）只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着，用户的每一轮追问都在悄悄抬高账单。\nAnthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。\nAnthropic选择轮次制（listen→think→speak）而非全双工，以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞，同时连接Gmail、Calendar、Slack等应用，每一步操作前都要求用户确认，核心逻辑是语音不只是一个交互界面，它应该能推动真实的工作流程。代价是交互节奏不如全双工自然，但在需要深思熟虑的场景中，轮次制的深度优于全双工的流畅。\n亚马逊走多模型路由，通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理，各司其职。6亿台Echo终端是Alexa的基本盘，但7月升级释放了更重要的信号，Alexa+已经跨出硬件，进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目，投入超过1亿美元GPU算力，目标是实现多任务联动交互，但高昂成本已在内部引发争议。\n这两家的共同判断是“不为全双工牺牲其他能力”，在大多数生产力场景中，用户要的是一个靠谱的结果，而不是一个能随时插话的聊天对象。\n而在光谱的另一端，Deepgram和AssemblyAI代表的传统语音专业厂商，仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%，低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的，每增加一个中间环节，就多一层延迟。对于车载和穿戴场景，传统流水线的天花板约在600至1500毫秒，而端到端方案已经下探到了300毫秒以下。\n这四种路线之外，还有一个不可忽视的变量正在浮现：端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行，都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束，待高通、苹果和车企定制芯片的迭代完成后，端侧语音推理有可能在2027至2028年进入主流量产。届时，云端语音API的商业模式将面临根本性挑战。\n当屏幕不再是默认界面\n从定价策略来看，SpaceXAI的战略意图很清晰。\nGrok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟，但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是，grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。\nOpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时，比GPT-Realtime-2.1的10.75/小时便宜六成，但比Grok Voice贵了近一倍。\n单独看每分钟几美分的价差微不足道。换算成商业场景：一个月10万分钟通话量（对大型客服中心而言并不罕见），Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互，价差将以百万美元计。\n但真正透露战略野心的，是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式，不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符，比OpenAI的约30低86%，比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略，只有在马斯克手中同时掌握特斯拉（终端）、Starlink（网络）和X（数据与分发）时才有商业合理性。语音API可以薄利甚至亏损，生态内的其他环节会加倍赚回来。\n这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑，与当年AWS碾压传统IDC如出一辙。\n特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱，它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力，每一次对话既是一次A/B测试，也是一条训练数据。\n车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据，全球车载语音助手市场2025年约为84亿美元，预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作，计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断，在自动驾驶逐步解放双手之后，语音将成为座舱的主交互通道。\n穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框；Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商，但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定，这本身就说明了一个事实，硬件厂商没有忠诚度，只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势，硬件厂商的切换只是时间问题。\n中国阵营，谁是主力？\n国内实时语音的竞争格局，远比一两家公司撑起来的场面要热闹。\n阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道，国内至少还有五家公司在同一方向上投入了实质性力量。\n字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构，已在超过700万辆量产车上落地，覆盖50多个汽车品牌。2026年4月，Seeduplex完成了新一轮升级，通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆，既有自研模型，又有抖音和火山引擎的庞大分发网络。\nMiniMax走的是另一条路：扎根语音基础设施，把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下，支持40多种语言，已被LiveKit（ChatGPT高级语音模式的技术栈）、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧，Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确：不跟OpenAI和SpaceXAI在通用大模型上正面拼，而在语音这个垂直层做到“谁的管道里都有我”。\n科大讯飞是语音领域的资深玩家，在国内市场的根基远比其他几家深厚。据IDC数据，讯飞在语音语义市场的份额为15.6%，位居第一。2026年2月发布的星火X2大模型基于全国产算力训练，6月集中发布了四款企业级AI应用，将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上，而在垂直场景的深度渗透：教育口语测评、医疗语音病历、政务热线智能坐席、车载语音，每一块都是需要行业know-how的硬骨头。\n百度在语音大模型上的投入也值得留意。2026年1月，百度发布了业界首个基于Cross-Attention的端到端语音语言大模型，响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次，依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络（比亚迪、吉利等12家车企搭载了小度车载系统），在“模型加终端”的维度上，百度是国内极少数能与字节对标的企业。\n智谱AI的GLM-4-Voice于2024年10月上线，是国内最早一批端到端语音大模型之一，在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音（98%准确率、方言识别提升30%）、腾讯视频的角色扮演语音通话等产品矩阵，把语音AI嵌入已有的超级App生态中。\n这六家中国公司加上阿里云，构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同，但在一个方向上高度重合：车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手，但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间，天壤之别。\n三个信号\n实时语音Agent的战局给出了三个清晰信号。\n速度即护城河。在文本大模型领域，一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中，100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先，但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒，这不只是快慢之分，是能用与不能用的区别。\n这个物理天花板指向一个清楚的终局，端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面：速度不是唯一标准，在需要深度推理和可靠执行的场景中，“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利，而是端到端、轮次制和混合路由各自占据不同场景的生态位。\n硬件决定终局。纯API模型公司正在面对一个现实，没有自有硬件终端，语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作，凡是拥有硬件出口的公司，在语音入口争夺中天然多一条命。\nOpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域，将在下一阶段处于被动。中国市场正以另一套武器打同一场仗，讯飞、字节、百度、阿里在车企供应链中的位置之战，复刻着同一逻辑。语音入口的竞争，说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型，迁移成本也会使替换变得不划算。一旦被设为默认，换掉它的交易成本就高到让多数人选择忍受。\n定价只是起点。Grok TTS定价比ElevenLabs低90%，Llama-Voice开源免费，MiniMax以250毫秒延迟服务全球平台，语音基础设施的价格正在被全面压平，但这只是表层。SpaceXAI靠生态反哺（特斯拉、Starlink、X），Meta靠开源铺设分发管道，微软靠平台锁定企业客户，亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式，真正的利润在生态的其他环节。\n对于开发者和硬件厂商，此刻需要做一个关键决策：绑定单一模型，还是多模型冗余？前者的成本最低但锁定风险最高；后者的延迟和体验优化复杂度将成倍增加。无论走哪条路，都不能再用“等一等再看”的心态观望。语音入口的窗口期，不会超过18个月。\n语音不是大模型的附加功能，它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下，比API合同难解除得多。（本文首发钛媒体APP，作者 | AGI-Signal，编辑 | 秦聪慧）","full_text":"全球语音大模型，角逐方向盘后的麦克风\n语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。\n7月，实时语音Agent战场上连爆多颗信号弹。\n7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。\n7月28日，阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录，登顶全球语音推理排行榜，但它的平均首音延迟高达4.02秒。7月29日，SpaceXAI（原xAI）发布Grok Voice Think Fast 2.0，首音延迟压到0.70秒，Big Bench Audio得分97.2%，在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先，GPT-Realtime-2.1 High是45.7%，Gemini 3.1 Flash High是37.7%。更早一些，7月6日，OpenAI也发布了GPT-Realtime-2.1。\nSpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦，而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。\n一场“毫秒级”军备竞赛\n过去半年，实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上：首音延迟、语音识别精度、调用成本。\n先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒，从用户说完话到AI开口，在大多数人尚未察觉的间隙就已完成了应答。作为对比，v1.0的TTFA是1.25秒，GPT-Realtime-2高推理模式是2.33秒，Gemini 3.1 Flash High是2.98秒，Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中，Grok TTS的流式模式首音延迟已压到285毫秒，标准模式460毫秒。2.0在此基础上进一步优化了推理效率：推理token减少60%，工具调用可以在用户说完第一句话之前就开始执行。\nxAI从一开始就把语音管线做成了一体化，自研语音活动检测、自研音频分词器、自研端到端语音模型，传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释：每绕过一层中间件，就省掉一层延迟和一层错误概率。\n在Artificial Analysis的综合语音质量指数上，Think Fast 2.0总评分82.9%，较v1.0的75.7%提升9.5%，超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%；Full Duplex Bench从77.8%跳升至95.1%，逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计，10倍于上一代，远超专业转录模型的水平。\n但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录，超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景：Flash面向实时交互（首包延迟300毫秒级）、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中，4秒意味着不可用。\n这个矛盾暴露了当前技术竞赛中一个绕不开的取舍：追求极致推理精度的模型，往往在延迟上买单，Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域，延迟是物理天花板，0.5秒以内的延迟让人感觉“在对话”，1.5秒左右就变成了“在等机器人”，到4秒，用户只会觉得“这功能坏了”。\nOpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后，旗舰模型音频输入32/百万token、输出64/百万token，mini版10和20。理论折算约0.05/分钟，独立开发者实测的数据则迅速偏离理论值，一个房产导览AI的实际均价约0.07/分钟，最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀，是OpenAI语音模型商业化绕不开的难题。\nGoogle Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉，某些模型版本从500毫秒增至1800毫秒，甚至10秒以上的等待，暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商，这种不稳定性比“慢”更致命。\n如果再把镜头拉远一点，比七月更早落子的还有两个重量级玩家。\n微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口，开发者不需要自己拼接语音管线。更关键的是微软的双重身份：它既是GPT-Realtime-2.1的云平台宿主（企业客户通过Azure调用OpenAI模型），又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通，支持WebSocket和WebRTC低延迟连接，直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线，客户一旦把语音Agent跑在Azure上，迁移成本远比切换一个API端点高得多。\nMeta则在开源侧投下了一枚重弹。4月，Meta以Apache 2.0协议开源了Llama-Voice，一个7B参数的TTS基础模型，支持52种语言，10秒音频即可零样本声音克隆，能在消费级GPU上实时运行。上线48小时下载量突破80万，社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2，支持100多种语言的实时语音翻译，延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端，Meta拥有从开源模型到消费硬件的完整通路，OpenAI恰好缺这一块。\n端到端、混合路由、轮次制、拼积木\nSpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下，但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊，至少能看到四种截然不同的技术选择。\n最激进的是Grok Voice的原生端到端路线。音频输入、音频输出，全由一个模型完成。这套架构最大胆的一点，是它在WebSocket连接中直接处理原始音频信号，不经过ASR转文本，也不经过TTS合成。60%的推理token压缩从侧面印证了这一点，2.0不需要把用户说的每句话都拆成详细文本再推理，模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%，而ElevenLabs为12.0%、Deepgram为13.5%。\n相比之下，OpenAI的Realtime API虽然标称支持端到端，在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费，上下文越长越贵，缓存机制（0.40/百万输入token旗舰版）只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着，用户的每一轮追问都在悄悄抬高账单。\nAnthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。\nAnthropic选择轮次制（listen→think→speak）而非全双工，以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞，同时连接Gmail、Calendar、Slack等应用，每一步操作前都要求用户确认，核心逻辑是语音不只是一个交互界面，它应该能推动真实的工作流程。代价是交互节奏不如全双工自然，但在需要深思熟虑的场景中，轮次制的深度优于全双工的流畅。\n亚马逊走多模型路由，通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理，各司其职。6亿台Echo终端是Alexa的基本盘，但7月升级释放了更重要的信号，Alexa+已经跨出硬件，进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目，投入超过1亿美元GPU算力，目标是实现多任务联动交互，但高昂成本已在内部引发争议。\n这两家的共同判断是“不为全双工牺牲其他能力”，在大多数生产力场景中，用户要的是一个靠谱的结果，而不是一个能随时插话的聊天对象。\n而在光谱的另一端，Deepgram和AssemblyAI代表的传统语音专业厂商，仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%，低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的，每增加一个中间环节，就多一层延迟。对于车载和穿戴场景，传统流水线的天花板约在600至1500毫秒，而端到端方案已经下探到了300毫秒以下。\n这四种路线之外，还有一个不可忽视的变量正在浮现：端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行，都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束，待高通、苹果和车企定制芯片的迭代完成后，端侧语音推理有可能在2027至2028年进入主流量产。届时，云端语音API的商业模式将面临根本性挑战。\n当屏幕不再是默认界面\n从定价策略来看，SpaceXAI的战略意图很清晰。\nGrok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟，但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是，grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。\nOpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时，比GPT-Realtime-2.1的10.75/小时便宜六成，但比Grok Voice贵了近一倍。\n单独看每分钟几美分的价差微不足道。换算成商业场景：一个月10万分钟通话量（对大型客服中心而言并不罕见），Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互，价差将以百万美元计。\n但真正透露战略野心的，是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式，不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符，比OpenAI的约30低86%，比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略，只有在马斯克手中同时掌握特斯拉（终端）、Starlink（网络）和X（数据与分发）时才有商业合理性。语音API可以薄利甚至亏损，生态内的其他环节会加倍赚回来。\n这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑，与当年AWS碾压传统IDC如出一辙。\n特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱，它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力，每一次对话既是一次A/B测试，也是一条训练数据。\n车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据，全球车载语音助手市场2025年约为84亿美元，预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作，计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断，在自动驾驶逐步解放双手之后，语音将成为座舱的主交互通道。\n穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框；Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商，但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定，这本身就说明了一个事实，硬件厂商没有忠诚度，只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势，硬件厂商的切换只是时间问题。\n中国阵营，谁是主力？\n国内实时语音的竞争格局，远比一两家公司撑起来的场面要热闹。\n阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道，国内至少还有五家公司在同一方向上投入了实质性力量。\n字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构，已在超过700万辆量产车上落地，覆盖50多个汽车品牌。2026年4月，Seeduplex完成了新一轮升级，通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆，既有自研模型，又有抖音和火山引擎的庞大分发网络。\nMiniMax走的是另一条路：扎根语音基础设施，把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下，支持40多种语言，已被LiveKit（ChatGPT高级语音模式的技术栈）、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧，Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确：不跟OpenAI和SpaceXAI在通用大模型上正面拼，而在语音这个垂直层做到“谁的管道里都有我”。\n科大讯飞是语音领域的资深玩家，在国内市场的根基远比其他几家深厚。据IDC数据，讯飞在语音语义市场的份额为15.6%，位居第一。2026年2月发布的星火X2大模型基于全国产算力训练，6月集中发布了四款企业级AI应用，将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上，而在垂直场景的深度渗透：教育口语测评、医疗语音病历、政务热线智能坐席、车载语音，每一块都是需要行业know-how的硬骨头。\n百度在语音大模型上的投入也值得留意。2026年1月，百度发布了业界首个基于Cross-Attention的端到端语音语言大模型，响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次，依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络（比亚迪、吉利等12家车企搭载了小度车载系统），在“模型加终端”的维度上，百度是国内极少数能与字节对标的企业。\n智谱AI的GLM-4-Voice于2024年10月上线，是国内最早一批端到端语音大模型之一，在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音（98%准确率、方言识别提升30%）、腾讯视频的角色扮演语音通话等产品矩阵，把语音AI嵌入已有的超级App生态中。\n这六家中国公司加上阿里云，构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同，但在一个方向上高度重合：车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手，但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间，天壤之别。\n三个信号\n实时语音Agent的战局给出了三个清晰信号。\n速度即护城河。在文本大模型领域，一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中，100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先，但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒，这不只是快慢之分，是能用与不能用的区别。\n这个物理天花板指向一个清楚的终局，端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面：速度不是唯一标准，在需要深度推理和可靠执行的场景中，“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利，而是端到端、轮次制和混合路由各自占据不同场景的生态位。\n硬件决定终局。纯API模型公司正在面对一个现实，没有自有硬件终端，语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作，凡是拥有硬件出口的公司，在语音入口争夺中天然多一条命。\nOpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域，将在下一阶段处于被动。中国市场正以另一套武器打同一场仗，讯飞、字节、百度、阿里在车企供应链中的位置之战，复刻着同一逻辑。语音入口的竞争，说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型，迁移成本也会使替换变得不划算。一旦被设为默认，换掉它的交易成本就高到让多数人选择忍受。\n定价只是起点。Grok TTS定价比ElevenLabs低90%，Llama-Voice开源免费，MiniMax以250毫秒延迟服务全球平台，语音基础设施的价格正在被全面压平，但这只是表层。SpaceXAI靠生态反哺（特斯拉、Starlink、X），Meta靠开源铺设分发管道，微软靠平台锁定企业客户，亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式，真正的利润在生态的其他环节。\n对于开发者和硬件厂商，此刻需要做一个关键决策：绑定单一模型，还是多模型冗余？前者的成本最低但锁定风险最高；后者的延迟和体验优化复杂度将成倍增加。无论走哪条路，都不能再用“等一等再看”的心态观望。语音入口的窗口期，不会超过18个月。\n语音不是大模型的附加功能，它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下，比API合同难解除得多。（本文首发钛媒体APP，作者 | AGI-Signal，编辑 | 秦聪慧）","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 8192 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1057823678_116132%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 8192 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":8192,"summary_length":8192,"usable_text_length":8192,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":8192,"summary_length":8192}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 8192 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":8192,"summary_length":8192,"usable_text_length":8192,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":8192,"summary_length":8192}},"actions":{"read":"/item/51481","export_markdown":"/api/items/51481/export?format=markdown","export_json":"/api/items/51481/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1057823678_116132%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"}},"digest":{"id":51481,"title":"全球语音大模型，角逐方向盘后的麦克风 - Sohu","url":"https://m.sohu.com/a/1057823678_116132?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"Sohu","topic":"ai","published_at":"2026-08-02T04:45:33+00:00","excerpt":"全球语音大模型，角逐方向盘后的麦克风 语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。 7月，实时语音Agent战场上连爆多颗信号弹。 7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 8192 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"全球语音大模型，角逐方向盘后的麦克风 - Sohu","subtitle":"Sohu · 2026-08-02","summary":"全球语音大模型，角逐方向盘后的麦克风 语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。 7月，实时语音Agent战场上连爆多颗信号弹。 7月23日，Anthropic为Claude…","badges":["quality:high"],"links":{"read":"/item/51481","original":"https://m.sohu.com/a/1057823678_116132?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1057823678_116132%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"quality_warning":null},"export":{"title":"全球语音大模型，角逐方向盘后的麦克风 - Sohu","url":"https://m.sohu.com/a/1057823678_116132?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"全球语音大模型，角逐方向盘后的麦克风\n语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。\n7月，实时语音Agent战场上连爆多颗信号弹。\n7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。\n7月28日，阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录，登顶全球语音推理排行榜，但它的平均首音延迟高达4.02秒。7月29日，SpaceXAI（原xAI）发布Grok Voice Think Fast 2.0，首音延迟压到0.70秒，Big Bench Audio得分97.2%，在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先，GPT-Realtime-2.1 High是45.7%，Gemini 3.1 Flash High是37.7%。更早一些，7月6日，OpenAI也发布了GPT-Realtime-2.1。\nSpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦，而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。\n一场“毫秒级”军备竞赛\n过去半年，实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上：首音延迟、语音识别精度、调用成本。\n先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒，从用户说完话到AI开口，在大多数人尚未察觉的间隙就已完成了应答。作为对比，v1.0的TTFA是1.25秒，GPT-Realtime-2高推理模式是2.33秒，Gemini 3.1 Flash High是2.98秒，Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中，Grok TTS的流式模式首音延迟已压到285毫秒，标准模式460毫秒。2.0在此基础上进一步优化了推理效率：推理token减少60%，工具调用可以在用户说完第一句话之前就开始执行。\nxAI从一开始就把语音管线做成了一体化，自研语音活动检测、自研音频分词器、自研端到端语音模型，传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释：每绕过一层中间件，就省掉一层延迟和一层错误概率。\n在Artificial Analysis的综合语音质量指数上，Think Fast 2.0总评分82.9%，较v1.0的75.7%提升9.5%，超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%；Full Duplex Bench从77.8%跳升至95.1%，逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计，10倍于上一代，远超专业转录模型的水平。\n但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录，超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景：Flash面向实时交互（首包延迟300毫秒级）、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中，4秒意味着不可用。\n这个矛盾暴露了当前技术竞赛中一个绕不开的取舍：追求极致推理精度的模型，往往在延迟上买单，Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域，延迟是物理天花板，0.5秒以内的延迟让人感觉“在对话”，1.5秒左右就变成了“在等机器人”，到4秒，用户只会觉得“这功能坏了”。\nOpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后，旗舰模型音频输入32/百万token、输出64/百万token，mini版10和20。理论折算约0.05/分钟，独立开发者实测的数据则迅速偏离理论值，一个房产导览AI的实际均价约0.07/分钟，最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀，是OpenAI语音模型商业化绕不开的难题。\nGoogle Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉，某些模型版本从500毫秒增至1800毫秒，甚至10秒以上的等待，暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商，这种不稳定性比“慢”更致命。\n如果再把镜头拉远一点，比七月更早落子的还有两个重量级玩家。\n微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口，开发者不需要自己拼接语音管线。更关键的是微软的双重身份：它既是GPT-Realtime-2.1的云平台宿主（企业客户通过Azure调用OpenAI模型），又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通，支持WebSocket和WebRTC低延迟连接，直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线，客户一旦把语音Agent跑在Azure上，迁移成本远比切换一个API端点高得多。\nMeta则在开源侧投下了一枚重弹。4月，Meta以Apache 2.0协议开源了Llama-Voice，一个7B参数的TTS基础模型，支持52种语言，10秒音频即可零样本声音克隆，能在消费级GPU上实时运行。上线48小时下载量突破80万，社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2，支持100多种语言的实时语音翻译，延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端，Meta拥有从开源模型到消费硬件的完整通路，OpenAI恰好缺这一块。\n端到端、混合路由、轮次制、拼积木\nSpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下，但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊，至少能看到四种截然不同的技术选择。\n最激进的是Grok Voice的原生端到端路线。音频输入、音频输出，全由一个模型完成。这套架构最大胆的一点，是它在WebSocket连接中直接处理原始音频信号，不经过ASR转文本，也不经过TTS合成。60%的推理token压缩从侧面印证了这一点，2.0不需要把用户说的每句话都拆成详细文本再推理，模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%，而ElevenLabs为12.0%、Deepgram为13.5%。\n相比之下，OpenAI的Realtime API虽然标称支持端到端，在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费，上下文越长越贵，缓存机制（0.40/百万输入token旗舰版）只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着，用户的每一轮追问都在悄悄抬高账单。\nAnthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。\nAnthropic选择轮次制（listen→think→speak）而非全双工，以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞，同时连接Gmail、Calendar、Slack等应用，每一步操作前都要求用户确认，核心逻辑是语音不只是一个交互界面，它应该能推动真实的工作流程。代价是交互节奏不如全双工自然，但在需要深思熟虑的场景中，轮次制的深度优于全双工的流畅。\n亚马逊走多模型路由，通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理，各司其职。6亿台Echo终端是Alexa的基本盘，但7月升级释放了更重要的信号，Alexa+已经跨出硬件，进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目，投入超过1亿美元GPU算力，目标是实现多任务联动交互，但高昂成本已在内部引发争议。\n这两家的共同判断是“不为全双工牺牲其他能力”，在大多数生产力场景中，用户要的是一个靠谱的结果，而不是一个能随时插话的聊天对象。\n而在光谱的另一端，Deepgram和AssemblyAI代表的传统语音专业厂商，仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%，低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的，每增加一个中间环节，就多一层延迟。对于车载和穿戴场景，传统流水线的天花板约在600至1500毫秒，而端到端方案已经下探到了300毫秒以下。\n这四种路线之外，还有一个不可忽视的变量正在浮现：端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行，都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束，待高通、苹果和车企定制芯片的迭代完成后，端侧语音推理有可能在2027至2028年进入主流量产。届时，云端语音API的商业模式将面临根本性挑战。\n当屏幕不再是默认界面\n从定价策略来看，SpaceXAI的战略意图很清晰。\nGrok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟，但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是，grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。\nOpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时，比GPT-Realtime-2.1的10.75/小时便宜六成，但比Grok Voice贵了近一倍。\n单独看每分钟几美分的价差微不足道。换算成商业场景：一个月10万分钟通话量（对大型客服中心而言并不罕见），Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互，价差将以百万美元计。\n但真正透露战略野心的，是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式，不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符，比OpenAI的约30低86%，比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略，只有在马斯克手中同时掌握特斯拉（终端）、Starlink（网络）和X（数据与分发）时才有商业合理性。语音API可以薄利甚至亏损，生态内的其他环节会加倍赚回来。\n这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑，与当年AWS碾压传统IDC如出一辙。\n特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱，它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力，每一次对话既是一次A/B测试，也是一条训练数据。\n车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据，全球车载语音助手市场2025年约为84亿美元，预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作，计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断，在自动驾驶逐步解放双手之后，语音将成为座舱的主交互通道。\n穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框；Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商，但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定，这本身就说明了一个事实，硬件厂商没有忠诚度，只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势，硬件厂商的切换只是时间问题。\n中国阵营，谁是主力？\n国内实时语音的竞争格局，远比一两家公司撑起来的场面要热闹。\n阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道，国内至少还有五家公司在同一方向上投入了实质性力量。\n字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构，已在超过700万辆量产车上落地，覆盖50多个汽车品牌。2026年4月，Seeduplex完成了新一轮升级，通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆，既有自研模型，又有抖音和火山引擎的庞大分发网络。\nMiniMax走的是另一条路：扎根语音基础设施，把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下，支持40多种语言，已被LiveKit（ChatGPT高级语音模式的技术栈）、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧，Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确：不跟OpenAI和SpaceXAI在通用大模型上正面拼，而在语音这个垂直层做到“谁的管道里都有我”。\n科大讯飞是语音领域的资深玩家，在国内市场的根基远比其他几家深厚。据IDC数据，讯飞在语音语义市场的份额为15.6%，位居第一。2026年2月发布的星火X2大模型基于全国产算力训练，6月集中发布了四款企业级AI应用，将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上，而在垂直场景的深度渗透：教育口语测评、医疗语音病历、政务热线智能坐席、车载语音，每一块都是需要行业know-how的硬骨头。\n百度在语音大模型上的投入也值得留意。2026年1月，百度发布了业界首个基于Cross-Attention的端到端语音语言大模型，响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次，依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络（比亚迪、吉利等12家车企搭载了小度车载系统），在“模型加终端”的维度上，百度是国内极少数能与字节对标的企业。\n智谱AI的GLM-4-Voice于2024年10月上线，是国内最早一批端到端语音大模型之一，在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音（98%准确率、方言识别提升30%）、腾讯视频的角色扮演语音通话等产品矩阵，把语音AI嵌入已有的超级App生态中。\n这六家中国公司加上阿里云，构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同，但在一个方向上高度重合：车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手，但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间，天壤之别。\n三个信号\n实时语音Agent的战局给出了三个清晰信号。\n速度即护城河。在文本大模型领域，一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中，100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先，但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒，这不只是快慢之分，是能用与不能用的区别。\n这个物理天花板指向一个清楚的终局，端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面：速度不是唯一标准，在需要深度推理和可靠执行的场景中，“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利，而是端到端、轮次制和混合路由各自占据不同场景的生态位。\n硬件决定终局。纯API模型公司正在面对一个现实，没有自有硬件终端，语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作，凡是拥有硬件出口的公司，在语音入口争夺中天然多一条命。\nOpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域，将在下一阶段处于被动。中国市场正以另一套武器打同一场仗，讯飞、字节、百度、阿里在车企供应链中的位置之战，复刻着同一逻辑。语音入口的竞争，说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型，迁移成本也会使替换变得不划算。一旦被设为默认，换掉它的交易成本就高到让多数人选择忍受。\n定价只是起点。Grok TTS定价比ElevenLabs低90%，Llama-Voice开源免费，MiniMax以250毫秒延迟服务全球平台，语音基础设施的价格正在被全面压平，但这只是表层。SpaceXAI靠生态反哺（特斯拉、Starlink、X），Meta靠开源铺设分发管道，微软靠平台锁定企业客户，亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式，真正的利润在生态的其他环节。\n对于开发者和硬件厂商，此刻需要做一个关键决策：绑定单一模型，还是多模型冗余？前者的成本最低但锁定风险最高；后者的延迟和体验优化复杂度将成倍增加。无论走哪条路，都不能再用“等一等再看”的心态观望。语音入口的窗口期，不会超过18个月。\n语音不是大模型的附加功能，它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下，比API合同难解除得多。（本文首发钛媒体APP，作者 | AGI-Signal，编辑 | 秦聪慧）","source":"Sohu","date":"2026-08-02T04:45:33+00:00","content":"全球语音大模型，角逐方向盘后的麦克风\n语音AI的战争，已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。\n7月，实时语音Agent战场上连爆多颗信号弹。\n7月23日，Anthropic为Claude Voice做了一次重大升级，语音模式不再局限于Haiku轻量模型，Opus和Sonnet开始驱动语音推理，同时接入了Gmail、Calendar、Slack等应用。7月24日，亚马逊升级Alexa+，支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话，背后是Nova和Anthropic Claude混合路由的模型架构。\n7月28日，阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录，登顶全球语音推理排行榜，但它的平均首音延迟高达4.02秒。7月29日，SpaceXAI（原xAI）发布Grok Voice Think Fast 2.0，首音延迟压到0.70秒，Big Bench Audio得分97.2%，在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先，GPT-Realtime-2.1 High是45.7%，Gemini 3.1 Flash High是37.7%。更早一些，7月6日，OpenAI也发布了GPT-Realtime-2.1。\nSpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦，而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。\n一场“毫秒级”军备竞赛\n过去半年，实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上：首音延迟、语音识别精度、调用成本。\n先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒，从用户说完话到AI开口，在大多数人尚未察觉的间隙就已完成了应答。作为对比，v1.0的TTFA是1.25秒，GPT-Realtime-2高推理模式是2.33秒，Gemini 3.1 Flash High是2.98秒，Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中，Grok TTS的流式模式首音延迟已压到285毫秒，标准模式460毫秒。2.0在此基础上进一步优化了推理效率：推理token减少60%，工具调用可以在用户说完第一句话之前就开始执行。\nxAI从一开始就把语音管线做成了一体化，自研语音活动检测、自研音频分词器、自研端到端语音模型，传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释：每绕过一层中间件，就省掉一层延迟和一层错误概率。\n在Artificial Analysis的综合语音质量指数上，Think Fast 2.0总评分82.9%，较v1.0的75.7%提升9.5%，超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%；Full Duplex Bench从77.8%跳升至95.1%，逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计，10倍于上一代，远超专业转录模型的水平。\n但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录，超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景：Flash面向实时交互（首包延迟300毫秒级）、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中，4秒意味着不可用。\n这个矛盾暴露了当前技术竞赛中一个绕不开的取舍：追求极致推理精度的模型，往往在延迟上买单，Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域，延迟是物理天花板，0.5秒以内的延迟让人感觉“在对话”，1.5秒左右就变成了“在等机器人”，到4秒，用户只会觉得“这功能坏了”。\nOpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后，旗舰模型音频输入32/百万token、输出64/百万token，mini版10和20。理论折算约0.05/分钟，独立开发者实测的数据则迅速偏离理论值，一个房产导览AI的实际均价约0.07/分钟，最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀，是OpenAI语音模型商业化绕不开的难题。\nGoogle Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉，某些模型版本从500毫秒增至1800毫秒，甚至10秒以上的等待，暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商，这种不稳定性比“慢”更致命。\n如果再把镜头拉远一点，比七月更早落子的还有两个重量级玩家。\n微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口，开发者不需要自己拼接语音管线。更关键的是微软的双重身份：它既是GPT-Realtime-2.1的云平台宿主（企业客户通过Azure调用OpenAI模型），又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通，支持WebSocket和WebRTC低延迟连接，直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线，客户一旦把语音Agent跑在Azure上，迁移成本远比切换一个API端点高得多。\nMeta则在开源侧投下了一枚重弹。4月，Meta以Apache 2.0协议开源了Llama-Voice，一个7B参数的TTS基础模型，支持52种语言，10秒音频即可零样本声音克隆，能在消费级GPU上实时运行。上线48小时下载量突破80万，社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2，支持100多种语言的实时语音翻译，延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端，Meta拥有从开源模型到消费硬件的完整通路，OpenAI恰好缺这一块。\n端到端、混合路由、轮次制、拼积木\nSpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下，但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊，至少能看到四种截然不同的技术选择。\n最激进的是Grok Voice的原生端到端路线。音频输入、音频输出，全由一个模型完成。这套架构最大胆的一点，是它在WebSocket连接中直接处理原始音频信号，不经过ASR转文本，也不经过TTS合成。60%的推理token压缩从侧面印证了这一点，2.0不需要把用户说的每句话都拆成详细文本再推理，模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%，而ElevenLabs为12.0%、Deepgram为13.5%。\n相比之下，OpenAI的Realtime API虽然标称支持端到端，在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费，上下文越长越贵，缓存机制（0.40/百万输入token旗舰版）只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着，用户的每一轮追问都在悄悄抬高账单。\nAnthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。\nAnthropic选择轮次制（listen→think→speak）而非全双工，以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞，同时连接Gmail、Calendar、Slack等应用，每一步操作前都要求用户确认，核心逻辑是语音不只是一个交互界面，它应该能推动真实的工作流程。代价是交互节奏不如全双工自然，但在需要深思熟虑的场景中，轮次制的深度优于全双工的流畅。\n亚马逊走多模型路由，通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理，各司其职。6亿台Echo终端是Alexa的基本盘，但7月升级释放了更重要的信号，Alexa+已经跨出硬件，进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目，投入超过1亿美元GPU算力，目标是实现多任务联动交互，但高昂成本已在内部引发争议。\n这两家的共同判断是“不为全双工牺牲其他能力”，在大多数生产力场景中，用户要的是一个靠谱的结果，而不是一个能随时插话的聊天对象。\n而在光谱的另一端，Deepgram和AssemblyAI代表的传统语音专业厂商，仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%，低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的，每增加一个中间环节，就多一层延迟。对于车载和穿戴场景，传统流水线的天花板约在600至1500毫秒，而端到端方案已经下探到了300毫秒以下。\n这四种路线之外，还有一个不可忽视的变量正在浮现：端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行，都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束，待高通、苹果和车企定制芯片的迭代完成后，端侧语音推理有可能在2027至2028年进入主流量产。届时，云端语音API的商业模式将面临根本性挑战。\n当屏幕不再是默认界面\n从定价策略来看，SpaceXAI的战略意图很清晰。\nGrok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟，但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是，grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。\nOpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时，比GPT-Realtime-2.1的10.75/小时便宜六成，但比Grok Voice贵了近一倍。\n单独看每分钟几美分的价差微不足道。换算成商业场景：一个月10万分钟通话量（对大型客服中心而言并不罕见），Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互，价差将以百万美元计。\n但真正透露战略野心的，是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式，不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符，比OpenAI的约30低86%，比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略，只有在马斯克手中同时掌握特斯拉（终端）、Starlink（网络）和X（数据与分发）时才有商业合理性。语音API可以薄利甚至亏损，生态内的其他环节会加倍赚回来。\n这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑，与当年AWS碾压传统IDC如出一辙。\n特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱，它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力，每一次对话既是一次A/B测试，也是一条训练数据。\n车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据，全球车载语音助手市场2025年约为84亿美元，预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作，计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断，在自动驾驶逐步解放双手之后，语音将成为座舱的主交互通道。\n穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框；Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商，但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定，这本身就说明了一个事实，硬件厂商没有忠诚度，只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势，硬件厂商的切换只是时间问题。\n中国阵营，谁是主力？\n国内实时语音的竞争格局，远比一两家公司撑起来的场面要热闹。\n阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道，国内至少还有五家公司在同一方向上投入了实质性力量。\n字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构，已在超过700万辆量产车上落地，覆盖50多个汽车品牌。2026年4月，Seeduplex完成了新一轮升级，通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆，既有自研模型，又有抖音和火山引擎的庞大分发网络。\nMiniMax走的是另一条路：扎根语音基础设施，把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下，支持40多种语言，已被LiveKit（ChatGPT高级语音模式的技术栈）、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧，Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确：不跟OpenAI和SpaceXAI在通用大模型上正面拼，而在语音这个垂直层做到“谁的管道里都有我”。\n科大讯飞是语音领域的资深玩家，在国内市场的根基远比其他几家深厚。据IDC数据，讯飞在语音语义市场的份额为15.6%，位居第一。2026年2月发布的星火X2大模型基于全国产算力训练，6月集中发布了四款企业级AI应用，将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上，而在垂直场景的深度渗透：教育口语测评、医疗语音病历、政务热线智能坐席、车载语音，每一块都是需要行业know-how的硬骨头。\n百度在语音大模型上的投入也值得留意。2026年1月，百度发布了业界首个基于Cross-Attention的端到端语音语言大模型，响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次，依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络（比亚迪、吉利等12家车企搭载了小度车载系统），在“模型加终端”的维度上，百度是国内极少数能与字节对标的企业。\n智谱AI的GLM-4-Voice于2024年10月上线，是国内最早一批端到端语音大模型之一，在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音（98%准确率、方言识别提升30%）、腾讯视频的角色扮演语音通话等产品矩阵，把语音AI嵌入已有的超级App生态中。\n这六家中国公司加上阿里云，构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同，但在一个方向上高度重合：车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手，但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间，天壤之别。\n三个信号\n实时语音Agent的战局给出了三个清晰信号。\n速度即护城河。在文本大模型领域，一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中，100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先，但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒，这不只是快慢之分，是能用与不能用的区别。\n这个物理天花板指向一个清楚的终局，端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面：速度不是唯一标准，在需要深度推理和可靠执行的场景中，“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利，而是端到端、轮次制和混合路由各自占据不同场景的生态位。\n硬件决定终局。纯API模型公司正在面对一个现实，没有自有硬件终端，语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作，凡是拥有硬件出口的公司，在语音入口争夺中天然多一条命。\nOpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域，将在下一阶段处于被动。中国市场正以另一套武器打同一场仗，讯飞、字节、百度、阿里在车企供应链中的位置之战，复刻着同一逻辑。语音入口的竞争，说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型，迁移成本也会使替换变得不划算。一旦被设为默认，换掉它的交易成本就高到让多数人选择忍受。\n定价只是起点。Grok TTS定价比ElevenLabs低90%，Llama-Voice开源免费，MiniMax以250毫秒延迟服务全球平台，语音基础设施的价格正在被全面压平，但这只是表层。SpaceXAI靠生态反哺（特斯拉、Starlink、X），Meta靠开源铺设分发管道，微软靠平台锁定企业客户，亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式，真正的利润在生态的其他环节。\n对于开发者和硬件厂商，此刻需要做一个关键决策：绑定单一模型，还是多模型冗余？前者的成本最低但锁定风险最高；后者的延迟和体验优化复杂度将成倍增加。无论走哪条路，都不能再用“等一等再看”的心态观望。语音入口的窗口期，不会超过18个月。\n语音不是大模型的附加功能，它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下，比API合同难解除得多。（本文首发钛媒体APP，作者 | AGI-Signal，编辑 | 秦聪慧）","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1057823678_116132%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 8192 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 8192 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":8192,"summary_length":8192,"usable_text_length":8192,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":8192,"summary_length":8192}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}