{"id":37052,"topic":"ai","source":"手机网易网","title":"AI 大厂集体转向，大模型迎来“杰文斯时刻” - 手机网易网","url":"https://www.163.com/dy/article/L1SMR3L705118O92.html","url_hash":"fe53ab73d22bff1256fe69a17c7eaa3d57d9e4d2","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiYkFVX3lxTE1IY0w3YjA2STdQS2p2cm1JS2RwMmp1TkdFcVVnVVJiTUk5ei1CSXdqSWk3N3QxbEg1aFJVU2QtZFlWVWpmZWpLQkNaU21ZQjltUTJxQ2RwM3dfMGx4Zko2aURn?oc=5\" target=\"_blank\">AI 大厂集体转向，大模型迎来“杰文斯时刻”</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">手机网易网</font>","content":"文 | 深流研究所，作者 | 绛枫\n过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。\n比发布密度更值得注意的，是这些公司对模型的新叙事。\n最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。\n同样的转向，也在另外两家发生。\nOpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic 则说，Sonnet 5 能完成的智能体任务，在几个月前还需要更大、更贵的模型。\n当“更便宜”成了行业默认动作，真正的竞争就不再是“降多少价”，而是同样的价格，谁的模型能干更多、更难的任务？\n性价比，开始成为竞争的核心变量。\n1、性价比之争，模型公司重新组合能力、成本与场景\n这种变化首先体现在模型产品本身。模型公司开始把不同能力、不同成本和不同调用方式重新组合起来。\nOpenAI 的 GPT-5.6 最典型。“Sol / Terra / Luna”取代了过去几年“旗舰 + mini/nano”的模型命名体系。这改变了模型分层的逻辑——以前按强弱排序，现在按场景分工。\nSol 承担复杂推理、编程和 Agent 等高难任务，但价格与 GPT-5.5 标准旗舰持平；Terra 的综合表现接近 GPT-5.5，却落在 GPT-5.4 的中端价格区间；Luna 与开源 GLM-5.2 处在同一价位，主打高并发、低延迟的走量调用。\n这套分层的核心，是让能力跟着场景走、成本跟着任务变。复杂任务用旗舰能力，日常任务用主力模型，高频调用优先低延迟和低成本。\nOpenAI 今年 3 月推出Standard / Batch / Flex / Priority 定价机制，进一步把这种思路推进到调用层面。同一个模型，也可以按调用方式定价。能批处理、可等待的请求更便宜；追求低延迟、高确定性的请求更贵。\n这意味着，价格不再只取决于模型能力，也取决于任务对时间和稳定性的要求。过去隐藏在系统调度里的延迟、优先级和确定性，正在被直接写进计费结构。\n6 月底，Anthropic 发布 Claude Sonnet 5 同样指向这一趋势。Sonnet 5 内置了 effort 机制。它让调用方可以根据任务复杂度调节推理强度——中等 effort 用来控制成本，高 effort 才逼近旗舰表现。\n这打破了“选定模型就锁定成本”的旧逻辑。开发者不再只是选择用哪个模型，也可以决定一次调用投入多少算力。性价比因此从静态参数，变成了动态调节。\n7 月 9 日发布的 Grok 4.5，则把性价比前置到了训练阶段：先锁定高频场景，再围绕场景定义模型能力和成本结构。\nGrok 4.5 是 xAI 首个专门针对编程和智能体任务训练的模型，与 Cursor 联合训练，使用了 Cursor 上大量真实交互数据。定价为每百万 token 2 美元输入、6 美元输出，同时提供 MoE 架构、500K 上下文和可配置推理强度。\n编程和 Agent 往往上下文长、调用频繁、链路复杂，一次失败还会触发多轮重试，成本最容易被放大。Grok 4.5 选择先锁定 Cursor 这样的高频入口，再围绕真实调用优化能力和成本。\n这三款模型共同说明，性价比已经不再是一个简单的价格标签。OpenAI 是把不同能力放进不同调用场景；Anthropic 是把旗舰能力压进主力价格区间，并开放推理强度调节；Grok 则是在高频编程场景里重新计算“划算”的标准。\n大模型竞争正在从“能力最大化”转向“有效能力的成本最优化”。\n2、性价比的经济账，从“token 单价”到“单任务成本”\n不同于传统互联网 App，AI 产品每一次调用，都对应一次真实的推理成本。使用越多，价值越大，成本压力也越真实。\n模型竞争进入应用阶段，性价比正在从“价格问题”，延伸为“商业模式问题”。当模型真正进入真实任务场景，决定商业可持续性的，是模型能力能不能在高频调用中，被稳定、低成本地交付出来。\n一个真实任务的成本，通常由一整条任务链路共同决定：输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等，都会被计入最终账本。\n这也带来一个反直觉结论：定价便宜的模型，未必真的便宜。\n如果单次 token 价格低，却需要更多轮对话、更长上下文、更高重试率，那么单位任务成本未必低。反过来，一个看似更贵的模型，如果能用更少轮次完成任务，减少返工、降低失败率，最终反而可能更划算。\n模型性价比的衡量单位正在发生变化——不只看 token 单价，还有完成单个任务所需的成本。\n过去一年，国内模型公司普遍转向 MoE 和稀疏激活，也可以放在这一框架下理解。\nDeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B；Qwen3-235B-A22B 是 235B 总参数、22B 激活；Kimi K2.6 是 1T 总参数、32B 激活。近期发布的腾讯混元 Hy3 正式版，也采用 MoE 架构，295B 总参数、21B 激活参数，并支持 256K 上下文。\n国产大模型集体押注“大参数 + 小激活”，这说明模型能力与调用成本之间的关系，正在被重新设计。\n总参数决定模型的能力池有多大，能覆盖多少知识、推理、代码和 Agent 任务；激活参数决定一次推理真正要支付多少计算成本。MoE 的关键价值正在于此：\n让模型拥有接近超大规模模型的能力边界，同时让每次调用不必承担全量参数的计算开销。\n换句话说，性价比已经前置到模型架构设计阶段，而不再只是模型发布后的定价策略。\n腾讯混元 Hy3 正式版，正是这一趋势的近期样本。它的看点不只是 295B 总参数，更在于用 21B 激活参数承接一个更大的能力池，并将能力重点放在 Agent、办公、知识处理、多文件生成等真实任务上。\n此外，Hy3 正式版智能水平显著强于同尺寸模型，效果可比肩参数规模为其 2—5 倍的旗舰模型。这意味着，Hy3 能用更少的实际激活计算，承接更复杂的任务类型。\n从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，也说明模型经济性开始被真实调用规模检验。\n对国产模型厂商来说，性价比不只体现在开源和 API 价格上，更体现在能否在真实产品和开发者调用中，以更低成本支撑更多任务。\n因此，这一轮性价比竞争，本质上正在变成“单任务经济性”的竞争。\n未来模型公司比拼的，不只是能力池有多大，更是每个任务实际要为这座能力池支付多少成本。谁能用更少计算、更少轮次、更少重试，完成更多真实任务，谁才真正拥有更高的性价比。\n3、“默认调用”之争，大模型迎来“杰文斯时刻”\n当性价比的衡量单位转向“单任务成本”，模型竞争的重心也随之改变。企业和开发者真正关心的，正在从“哪个模型最强”，转向“哪个模型能被长期、稳定、低成本地默认调用”。\n所谓默认调用，指的是模型在办公、知识管理、Agent、客服、代码等高频场景中，系统优先调用的底层能力。它未必总被用户看见，却会持续承接大量真实任务。\n这种变化，已经开始被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router，本质上都在把模型调用从“手动选择”，推进到“统一调度”：系统根据任务复杂度、成本、延迟和性能，将请求路由到更合适的模型。\n开发者生态中的 OpenRouter、LiteLLM、Dify，也在承担类似角色。统一 API、多模型路由、预算控制，以及推理模型等默认能力配置，正在把模型嵌入更上层的应用框架和企业 AI 网关。\n这会重塑模型市场的竞争方式。未来，很多调用未必由终端用户直接决定，而会由云平台、AI 网关、开发框架和企业中台提前分配。谁能进入这些系统的默认配置，谁就能获得更高比例的真实调用。\n默认调用的第一重价值，是规模。一个模型只要能承接企业和开发者每天稳定发生的大量任务，即便单次调用价格不高，也能形成更扎实的商业基本盘。\n规模还会带来反馈。真实任务中的失败率、重试率、用户修正、工具调用路径、上下文组织方式，都会反过来帮助模型和系统优化。模型的进化，离不开静态评测，更离不开真实使用中的暴露、修正与迭代。\n更关键的是，默认调用会带来生态绑定。开发者一旦围绕某个模型调好了提示词、工具调用、RAG 流程、Agent 框架、评测标准和安全策略，这个模型就会从一个可替换的 API，变成应用架构的一部分。\n由此，“性价比”会形成一个新的竞争飞轮：更低单任务成本，带来更多默认调用；更多默认调用，带来更大调用规模和更多真实反馈；真实反馈继续推动模型和系统优化，进一步降低单任务成本。\n腾讯混元 Hy3 与 WorkBuddy 的结合，体现了这一趋势。WorkBuddy 承接企业办公、文件处理、流程编排等高频任务，Hy3 则通过这一入口进入真实工作流。\n公开信息显示，从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，WorkBuddy 上自主选择 Hy3 preview 的用户数增长 6 倍；正式版在办公场景内部测评中，任务成功率从 72% 提升至 90%，平均耗时缩短约 34%。\n这说明模型开始被真实任务链路反复检验。任务规划、工具调度、多 Agent 协作等能力，只有进入办公场景，才会暴露出失败、重试、耗时和工具调用等具体问题，并反过来推动模型迭代。\n类似的协同优化，已经成为行业共同方向。\nGoogle 将 Gemini 深度嵌入 Gmail、Docs 等工作场景，围绕邮件、文档、会议纪要等高频任务优化；Adobe Firefly 也嵌入 Photoshop、Illustrator、Premiere 等创意工作流，让模型围绕真实编辑、生成和修改链路迭代。\n模型只有进入真实任务，才能获得稳定调用、真实反馈和持续优化空间，最终形成“模型—产品—场景”的协同优化。\n因此，性价比竞争已经超出降价竞赛本身。它真正改变的，是需求边界。\n19 世纪，经济学家杰文斯观察到一个现象：蒸汽机效率越高，煤炭消耗反而越多。效率提升没有抑制使用，反而降低了使用门槛，让煤炭进入更多产业、更多机器和更长的生产链条。\n大模型正在接近自己的“杰文斯时刻”。\n性价比竞争的结果，未必是 AI 总成本下降，而是 AI 使用密度上升。模型调用会从少数高价值任务，扩展到大量日常任务，最终让 AI 变得更实用，也更普惠。\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","image_url":null,"lang":"zh","published_at":"2026-07-15T05:02:08+00:00","fetched_at":"2026-07-15T06:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"文 | 深流研究所，作者 | 绛枫\n过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。\n比发布密度更值得注意的，是这些公司对模型的新叙事。\n最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。\n同样的转向，也在另外两家发生。\nOpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic 则说，Sonnet 5 能完成的智能体任务，在几个月前还需要更大、更贵的模型。\n当“更便宜”成了行业默认动作，真正的竞争就不再是“降多少价”，而是同样的价格，谁的模型能干更多、更难的任务？\n性价比，开始成为竞争的核心变量。\n1、性价比之争，模型公司重新组合能力、成本与场景\n这种变化首先体现在模型产品本身。模型公司开始把不同能力、不同成本和不同调用方式重新组合起来。\nOpenAI 的 GPT-5.6 最典型。“Sol / Terra / Luna”取代了过去几年“旗舰 + mini/nano”的模型命名体系。这改变了模型分层的逻辑——以前按强弱排序，现在按场景分工。\nSol 承担复杂推理、编程和 Agent 等高难任务，但价格与 GPT-5.5 标准旗舰持平；Terra 的综合表现接近 GPT-5.5，却落在 GPT-5.4 的中端价格区间；Luna 与开源 GLM-5.2 处在同一价位，主打高并发、低延迟的走量调用。\n这套分层的核心，是让能力跟着场景走、成本跟着任务变。复杂任务用旗舰能力，日常任务用主力模型，高频调用优先低延迟和低成本。\nOpenAI 今年 3 月推出Standard / Batch / Flex / Priority 定价机制，进一步把这种思路推进到调用层面。同一个模型，也可以按调用方式定价。能批处理、可等待的请求更便宜；追求低延迟、高确定性的请求更贵。\n这意味着，价格不再只取决于模型能力，也取决于任务对时间和稳定性的要求。过去隐藏在系统调度里的延迟、优先级和确定性，正在被直接写进计费结构。\n6 月底，Anthropic 发布 Claude Sonnet 5 同样指向这一趋势。Sonnet 5 内置了 effort 机制。它让调用方可以根据任务复杂度调节推理强度——中等 effort 用来控制成本，高 effort 才逼近旗舰表现。\n这打破了“选定模型就锁定成本”的旧逻辑。开发者不再只是选择用哪个模型，也可以决定一次调用投入多少算力。性价比因此从静态参数，变成了动态调节。\n7 月 9 日发布的 Grok 4.5，则把性价比前置到了训练阶段：先锁定高频场景，再围绕场景定义模型能力和成本结构。\nGrok 4.5 是 xAI 首个专门针对编程和智能体任务训练的模型，与 Cursor 联合训练，使用了 Cursor 上大量真实交互数据。定价为每百万 token 2 美元输入、6 美元输出，同时提供 MoE 架构、500K 上下文和可配置推理强度。\n编程和 Agent 往往上下文长、调用频繁、链路复杂，一次失败还会触发多轮重试，成本最容易被放大。Grok 4.5 选择先锁定 Cursor 这样的高频入口，再围绕真实调用优化能力和成本。\n这三款模型共同说明，性价比已经不再是一个简单的价格标签。OpenAI 是把不同能力放进不同调用场景；Anthropic 是把旗舰能力压进主力价格区间，并开放推理强度调节；Grok 则是在高频编程场景里重新计算“划算”的标准。\n大模型竞争正在从“能力最大化”转向“有效能力的成本最优化”。\n2、性价比的经济账，从“token 单价”到“单任务成本”\n不同于传统互联网 App，AI 产品每一次调用，都对应一次真实的推理成本。使用越多，价值越大，成本压力也越真实。\n模型竞争进入应用阶段，性价比正在从“价格问题”，延伸为“商业模式问题”。当模型真正进入真实任务场景，决定商业可持续性的，是模型能力能不能在高频调用中，被稳定、低成本地交付出来。\n一个真实任务的成本，通常由一整条任务链路共同决定：输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等，都会被计入最终账本。\n这也带来一个反直觉结论：定价便宜的模型，未必真的便宜。\n如果单次 token 价格低，却需要更多轮对话、更长上下文、更高重试率，那么单位任务成本未必低。反过来，一个看似更贵的模型，如果能用更少轮次完成任务，减少返工、降低失败率，最终反而可能更划算。\n模型性价比的衡量单位正在发生变化——不只看 token 单价，还有完成单个任务所需的成本。\n过去一年，国内模型公司普遍转向 MoE 和稀疏激活，也可以放在这一框架下理解。\nDeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B；Qwen3-235B-A22B 是 235B 总参数、22B 激活；Kimi K2.6 是 1T 总参数、32B 激活。近期发布的腾讯混元 Hy3 正式版，也采用 MoE 架构，295B 总参数、21B 激活参数，并支持 256K 上下文。\n国产大模型集体押注“大参数 + 小激活”，这说明模型能力与调用成本之间的关系，正在被重新设计。\n总参数决定模型的能力池有多大，能覆盖多少知识、推理、代码和 Agent 任务；激活参数决定一次推理真正要支付多少计算成本。MoE 的关键价值正在于此：\n让模型拥有接近超大规模模型的能力边界，同时让每次调用不必承担全量参数的计算开销。\n换句话说，性价比已经前置到模型架构设计阶段，而不再只是模型发布后的定价策略。\n腾讯混元 Hy3 正式版，正是这一趋势的近期样本。它的看点不只是 295B 总参数，更在于用 21B 激活参数承接一个更大的能力池，并将能力重点放在 Agent、办公、知识处理、多文件生成等真实任务上。\n此外，Hy3 正式版智能水平显著强于同尺寸模型，效果可比肩参数规模为其 2—5 倍的旗舰模型。这意味着，Hy3 能用更少的实际激活计算，承接更复杂的任务类型。\n从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，也说明模型经济性开始被真实调用规模检验。\n对国产模型厂商来说，性价比不只体现在开源和 API 价格上，更体现在能否在真实产品和开发者调用中，以更低成本支撑更多任务。\n因此，这一轮性价比竞争，本质上正在变成“单任务经济性”的竞争。\n未来模型公司比拼的，不只是能力池有多大，更是每个任务实际要为这座能力池支付多少成本。谁能用更少计算、更少轮次、更少重试，完成更多真实任务，谁才真正拥有更高的性价比。\n3、“默认调用”之争，大模型迎来“杰文斯时刻”\n当性价比的衡量单位转向“单任务成本”，模型竞争的重心也随之改变。企业和开发者真正关心的，正在从“哪个模型最强”，转向“哪个模型能被长期、稳定、低成本地默认调用”。\n所谓默认调用，指的是模型在办公、知识管理、Agent、客服、代码等高频场景中，系统优先调用的底层能力。它未必总被用户看见，却会持续承接大量真实任务。\n这种变化，已经开始被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router，本质上都在把模型调用从“手动选择”，推进到“统一调度”：系统根据任务复杂度、成本、延迟和性能，将请求路由到更合适的模型。\n开发者生态中的 OpenRouter、LiteLLM、Dify，也在承担类似角色。统一 API、多模型路由、预算控制，以及推理模型等默认能力配置，正在把模型嵌入更上层的应用框架和企业 AI 网关。\n这会重塑模型市场的竞争方式。未来，很多调用未必由终端用户直接决定，而会由云平台、AI 网关、开发框架和企业中台提前分配。谁能进入这些系统的默认配置，谁就能获得更高比例的真实调用。\n默认调用的第一重价值，是规模。一个模型只要能承接企业和开发者每天稳定发生的大量任务，即便单次调用价格不高，也能形成更扎实的商业基本盘。\n规模还会带来反馈。真实任务中的失败率、重试率、用户修正、工具调用路径、上下文组织方式，都会反过来帮助模型和系统优化。模型的进化，离不开静态评测，更离不开真实使用中的暴露、修正与迭代。\n更关键的是，默认调用会带来生态绑定。开发者一旦围绕某个模型调好了提示词、工具调用、RAG 流程、Agent 框架、评测标准和安全策略，这个模型就会从一个可替换的 API，变成应用架构的一部分。\n由此，“性价比”会形成一个新的竞争飞轮：更低单任务成本，带来更多默认调用；更多默认调用，带来更大调用规模和更多真实反馈；真实反馈继续推动模型和系统优化，进一步降低单任务成本。\n腾讯混元 Hy3 与 WorkBuddy 的结合，体现了这一趋势。WorkBuddy 承接企业办公、文件处理、流程编排等高频任务，Hy3 则通过这一入口进入真实工作流。\n公开信息显示，从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，WorkBuddy 上自主选择 Hy3 preview 的用户数增长 6 倍；正式版在办公场景内部测评中，任务成功率从 72% 提升至 90%，平均耗时缩短约 34%。\n这说明模型开始被真实任务链路反复检验。任务规划、工具调度、多 Agent 协作等能力，只有进入办公场景，才会暴露出失败、重试、耗时和工具调用等具体问题，并反过来推动模型迭代。\n类似的协同优化，已经成为行业共同方向。\nGoogle 将 Gemini 深度嵌入 Gmail、Docs 等工作场景，围绕邮件、文档、会议纪要等高频任务优化；Adobe Firefly 也嵌入 Photoshop、Illustrator、Premiere 等创意工作流，让模型围绕真实编辑、生成和修改链路迭代。\n模型只有进入真实任务，才能获得稳定调用、真实反馈和持续优化空间，最终形成“模型—产品—场景”的协同优化。\n因此，性价比竞争已经超出降价竞赛本身。它真正改变的，是需求边界。\n19 世纪，经济学家杰文斯观察到一个现象：蒸汽机效率越高，煤炭消耗反而越多。效率提升没有抑制使用，反而降低了使用门槛，让煤炭进入更多产业、更多机器和更长的生产链条。\n大模型正在接近自己的“杰文斯时刻”。\n性价比竞争的结果，未必是 AI 总成本下降，而是 AI 使用密度上升。模型调用会从少数高价值任务，扩展到大量日常任务，最终让 AI 变得更实用，也更普惠。\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","cluster_id":1774585,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.163.com/dy/article/L1SMR3L705118O92.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4675 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4675,"summary_length":4675,"usable_text_length":4675,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4675,"summary_length":4675}},"news_item":{"id":37052,"canonical_url":"https://www.163.com/dy/article/L1SMR3L705118O92.html","source_url":"https://www.163.com/dy/article/L1SMR3L705118O92.html","title":"AI 大厂集体转向，大模型迎来“杰文斯时刻” - 手机网易网","source_name":"手机网易网","author":null,"published_at":"2026-07-15T05:02:08+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiYkFVX3lxTE1IY0w3YjA2STdQS2p2cm1JS2RwMmp1TkdFcVVnVVJiTUk5ei1CSXdqSWk3N3QxbEg1aFJVU2QtZFlWVWpmZWpLQkNaU21ZQjltUTJxQ2RwM3dfMGx4Zko2aURn?oc=5\" target=\"_blank\">AI 大厂集体转向，大模型迎来“杰文斯时刻”</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">手机网易网</font>","full_text":"文 | 深流研究所，作者 | 绛枫\n过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。\n比发布密度更值得注意的，是这些公司对模型的新叙事。\n最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。\n同样的转向，也在另外两家发生。\nOpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic 则说，Sonnet 5 能完成的智能体任务，在几个月前还需要更大、更贵的模型。\n当“更便宜”成了行业默认动作，真正的竞争就不再是“降多少价”，而是同样的价格，谁的模型能干更多、更难的任务？\n性价比，开始成为竞争的核心变量。\n1、性价比之争，模型公司重新组合能力、成本与场景\n这种变化首先体现在模型产品本身。模型公司开始把不同能力、不同成本和不同调用方式重新组合起来。\nOpenAI 的 GPT-5.6 最典型。“Sol / Terra / Luna”取代了过去几年“旗舰 + mini/nano”的模型命名体系。这改变了模型分层的逻辑——以前按强弱排序，现在按场景分工。\nSol 承担复杂推理、编程和 Agent 等高难任务，但价格与 GPT-5.5 标准旗舰持平；Terra 的综合表现接近 GPT-5.5，却落在 GPT-5.4 的中端价格区间；Luna 与开源 GLM-5.2 处在同一价位，主打高并发、低延迟的走量调用。\n这套分层的核心，是让能力跟着场景走、成本跟着任务变。复杂任务用旗舰能力，日常任务用主力模型，高频调用优先低延迟和低成本。\nOpenAI 今年 3 月推出Standard / Batch / Flex / Priority 定价机制，进一步把这种思路推进到调用层面。同一个模型，也可以按调用方式定价。能批处理、可等待的请求更便宜；追求低延迟、高确定性的请求更贵。\n这意味着，价格不再只取决于模型能力，也取决于任务对时间和稳定性的要求。过去隐藏在系统调度里的延迟、优先级和确定性，正在被直接写进计费结构。\n6 月底，Anthropic 发布 Claude Sonnet 5 同样指向这一趋势。Sonnet 5 内置了 effort 机制。它让调用方可以根据任务复杂度调节推理强度——中等 effort 用来控制成本，高 effort 才逼近旗舰表现。\n这打破了“选定模型就锁定成本”的旧逻辑。开发者不再只是选择用哪个模型，也可以决定一次调用投入多少算力。性价比因此从静态参数，变成了动态调节。\n7 月 9 日发布的 Grok 4.5，则把性价比前置到了训练阶段：先锁定高频场景，再围绕场景定义模型能力和成本结构。\nGrok 4.5 是 xAI 首个专门针对编程和智能体任务训练的模型，与 Cursor 联合训练，使用了 Cursor 上大量真实交互数据。定价为每百万 token 2 美元输入、6 美元输出，同时提供 MoE 架构、500K 上下文和可配置推理强度。\n编程和 Agent 往往上下文长、调用频繁、链路复杂，一次失败还会触发多轮重试，成本最容易被放大。Grok 4.5 选择先锁定 Cursor 这样的高频入口，再围绕真实调用优化能力和成本。\n这三款模型共同说明，性价比已经不再是一个简单的价格标签。OpenAI 是把不同能力放进不同调用场景；Anthropic 是把旗舰能力压进主力价格区间，并开放推理强度调节；Grok 则是在高频编程场景里重新计算“划算”的标准。\n大模型竞争正在从“能力最大化”转向“有效能力的成本最优化”。\n2、性价比的经济账，从“token 单价”到“单任务成本”\n不同于传统互联网 App，AI 产品每一次调用，都对应一次真实的推理成本。使用越多，价值越大，成本压力也越真实。\n模型竞争进入应用阶段，性价比正在从“价格问题”，延伸为“商业模式问题”。当模型真正进入真实任务场景，决定商业可持续性的，是模型能力能不能在高频调用中，被稳定、低成本地交付出来。\n一个真实任务的成本，通常由一整条任务链路共同决定：输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等，都会被计入最终账本。\n这也带来一个反直觉结论：定价便宜的模型，未必真的便宜。\n如果单次 token 价格低，却需要更多轮对话、更长上下文、更高重试率，那么单位任务成本未必低。反过来，一个看似更贵的模型，如果能用更少轮次完成任务，减少返工、降低失败率，最终反而可能更划算。\n模型性价比的衡量单位正在发生变化——不只看 token 单价，还有完成单个任务所需的成本。\n过去一年，国内模型公司普遍转向 MoE 和稀疏激活，也可以放在这一框架下理解。\nDeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B；Qwen3-235B-A22B 是 235B 总参数、22B 激活；Kimi K2.6 是 1T 总参数、32B 激活。近期发布的腾讯混元 Hy3 正式版，也采用 MoE 架构，295B 总参数、21B 激活参数，并支持 256K 上下文。\n国产大模型集体押注“大参数 + 小激活”，这说明模型能力与调用成本之间的关系，正在被重新设计。\n总参数决定模型的能力池有多大，能覆盖多少知识、推理、代码和 Agent 任务；激活参数决定一次推理真正要支付多少计算成本。MoE 的关键价值正在于此：\n让模型拥有接近超大规模模型的能力边界，同时让每次调用不必承担全量参数的计算开销。\n换句话说，性价比已经前置到模型架构设计阶段，而不再只是模型发布后的定价策略。\n腾讯混元 Hy3 正式版，正是这一趋势的近期样本。它的看点不只是 295B 总参数，更在于用 21B 激活参数承接一个更大的能力池，并将能力重点放在 Agent、办公、知识处理、多文件生成等真实任务上。\n此外，Hy3 正式版智能水平显著强于同尺寸模型，效果可比肩参数规模为其 2—5 倍的旗舰模型。这意味着，Hy3 能用更少的实际激活计算，承接更复杂的任务类型。\n从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，也说明模型经济性开始被真实调用规模检验。\n对国产模型厂商来说，性价比不只体现在开源和 API 价格上，更体现在能否在真实产品和开发者调用中，以更低成本支撑更多任务。\n因此，这一轮性价比竞争，本质上正在变成“单任务经济性”的竞争。\n未来模型公司比拼的，不只是能力池有多大，更是每个任务实际要为这座能力池支付多少成本。谁能用更少计算、更少轮次、更少重试，完成更多真实任务，谁才真正拥有更高的性价比。\n3、“默认调用”之争，大模型迎来“杰文斯时刻”\n当性价比的衡量单位转向“单任务成本”，模型竞争的重心也随之改变。企业和开发者真正关心的，正在从“哪个模型最强”，转向“哪个模型能被长期、稳定、低成本地默认调用”。\n所谓默认调用，指的是模型在办公、知识管理、Agent、客服、代码等高频场景中，系统优先调用的底层能力。它未必总被用户看见，却会持续承接大量真实任务。\n这种变化，已经开始被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router，本质上都在把模型调用从“手动选择”，推进到“统一调度”：系统根据任务复杂度、成本、延迟和性能，将请求路由到更合适的模型。\n开发者生态中的 OpenRouter、LiteLLM、Dify，也在承担类似角色。统一 API、多模型路由、预算控制，以及推理模型等默认能力配置，正在把模型嵌入更上层的应用框架和企业 AI 网关。\n这会重塑模型市场的竞争方式。未来，很多调用未必由终端用户直接决定，而会由云平台、AI 网关、开发框架和企业中台提前分配。谁能进入这些系统的默认配置，谁就能获得更高比例的真实调用。\n默认调用的第一重价值，是规模。一个模型只要能承接企业和开发者每天稳定发生的大量任务，即便单次调用价格不高，也能形成更扎实的商业基本盘。\n规模还会带来反馈。真实任务中的失败率、重试率、用户修正、工具调用路径、上下文组织方式，都会反过来帮助模型和系统优化。模型的进化，离不开静态评测，更离不开真实使用中的暴露、修正与迭代。\n更关键的是，默认调用会带来生态绑定。开发者一旦围绕某个模型调好了提示词、工具调用、RAG 流程、Agent 框架、评测标准和安全策略，这个模型就会从一个可替换的 API，变成应用架构的一部分。\n由此，“性价比”会形成一个新的竞争飞轮：更低单任务成本，带来更多默认调用；更多默认调用，带来更大调用规模和更多真实反馈；真实反馈继续推动模型和系统优化，进一步降低单任务成本。\n腾讯混元 Hy3 与 WorkBuddy 的结合，体现了这一趋势。WorkBuddy 承接企业办公、文件处理、流程编排等高频任务，Hy3 则通过这一入口进入真实工作流。\n公开信息显示，从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，WorkBuddy 上自主选择 Hy3 preview 的用户数增长 6 倍；正式版在办公场景内部测评中，任务成功率从 72% 提升至 90%，平均耗时缩短约 34%。\n这说明模型开始被真实任务链路反复检验。任务规划、工具调度、多 Agent 协作等能力，只有进入办公场景，才会暴露出失败、重试、耗时和工具调用等具体问题，并反过来推动模型迭代。\n类似的协同优化，已经成为行业共同方向。\nGoogle 将 Gemini 深度嵌入 Gmail、Docs 等工作场景，围绕邮件、文档、会议纪要等高频任务优化；Adobe Firefly 也嵌入 Photoshop、Illustrator、Premiere 等创意工作流，让模型围绕真实编辑、生成和修改链路迭代。\n模型只有进入真实任务，才能获得稳定调用、真实反馈和持续优化空间，最终形成“模型—产品—场景”的协同优化。\n因此，性价比竞争已经超出降价竞赛本身。它真正改变的，是需求边界。\n19 世纪，经济学家杰文斯观察到一个现象：蒸汽机效率越高，煤炭消耗反而越多。效率提升没有抑制使用，反而降低了使用门槛，让煤炭进入更多产业、更多机器和更长的生产链条。\n大模型正在接近自己的“杰文斯时刻”。\n性价比竞争的结果，未必是 AI 总成本下降，而是 AI 使用密度上升。模型调用会从少数高价值任务，扩展到大量日常任务，最终让 AI 变得更实用，也更普惠。\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","excerpt":"文 | 深流研究所，作者 | 绛枫\n过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。\n比发布密度更值得注意的，是这些公司对模型的新叙事。\n最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。\n同样的转向，也在另外两家发生。\nOpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic 则说，Sonnet 5 能完成的智能体任务，在几个月前还需要更大、更贵的模型。\n当“更便宜”成了行业默认动作，真正的竞争就不再是“降多少价”，而是同样的价格，谁的模型能干更多、更难的任务？\n性价比，开始成为竞争的核心变量。\n1、性价比之争，模型公司重新组合能力、成本与场景\n这种变化首先体现在模型产品本身。模型公司开始把不同能力、不同成本和不同调用方式重新组合起来。\nOpenAI 的 GPT-5.6 最典型。“Sol / Terra / Luna”取代了过去几年“旗舰 + mini/nano”的模型命名体系。这改变了模型分层的逻辑——以前按强弱排序，现在按场景分工。\nSol 承担复杂推理、编程和 Agent 等高难任务，但价格与 GPT-5.5 标准旗舰持平；Terra 的综合表现接近 GPT-5.5，却落在 GPT-5.4 的中端价格区间；Luna 与开源 GLM-5.2 处在同一价位，主打高并发、低延迟的走量调用。\n这套分层的核心，是让能力跟着场景走、成本跟着任务变。复杂任务用旗舰能力，日常任务用主力模型，高频调用优先低延迟和低成本。\nOpenAI 今年 3 月推出Standard / Batch / Flex / Priority 定价机制，进一步把这种思路推进到调用层面。同一个模型，也可以按调用方式定价。能批处理、可等待的请求更便宜；追求低延迟、高确定性的请求更贵。\n这意味着，价格不再只取决于模型能力，也取决于任务对时间和稳定性的要求。过去隐藏在系统调度里的延迟、优先级和确定性，正在被直接写进计费结构。\n6 月底，Anthropic 发布 Claude Sonnet 5 同样指向这一趋势。Sonnet 5 内置了 effort 机制。它让调用方可以根据任务复杂度调节推理强度——中等 effort 用来控制成本，高 effort 才逼近旗舰表现。\n这打破了“选定模型就锁定成本”的旧逻辑。开发者不再只是选择用哪个模型，也可以决定一次调用投入多少算力。性价比因此从静态参数，变成了动态调节。\n7 月 9 日发布的 Grok 4.5，则把性价比前置到了训练阶段：先锁定高频场景，再围绕场景定义模型能力和成本结构。\nGrok 4.5 是 xAI 首个专门针对编程和智能体任务训练的模型，与 Cursor 联合训练，使用了 Cursor 上大量真实交互数据。定价为每百万 token 2 美元输入、6 美元输出，同时提供 MoE 架构、500K 上下文和可配置推理强度。\n编程和 Agent 往往上下文长、调用频繁、链路复杂，一次失败还会触发多轮重试，成本最容易被放大。Grok 4.5 选择先锁定 Cursor 这样的高频入口，再围绕真实调用优化能力和成本。\n这三款模型共同说明，性价比已经不再是一个简单的价格标签。OpenAI 是把不同能力放进不同调用场景；Anthropic 是把旗舰能力压进主力价格区间，并开放推理强度调节；Grok 则是在高频编程场景里重新计算“划算”的标准。\n大模型竞争正在从“能力最大化”转向“有效能力的成本最优化”。\n2、性价比的经济账，从“token 单价”到“单任务成本”\n不同于传统互联网 App，AI 产品每一次调用，都对应一次真实的推理成本。使用越多，价值越大，成本压力也越真实。\n模型竞争进入应用阶段，性价比正在从“价格问题”，延伸为“商业模式问题”。当模型真正进入真实任务场景，决定商业可持续性的，是模型能力能不能在高频调用中，被稳定、低成本地交付出来。\n一个真实任务的成本，通常由一整条任务链路共同决定：输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等，都会被计入最终账本。\n这也带来一个反直觉结论：定价便宜的模型，未必真的便宜。\n如果单次 token 价格低，却需要更多轮对话、更长上下文、更高重试率，那么单位任务成本未必低。反过来，一个看似更贵的模型，如果能用更少轮次完成任务，减少返工、降低失败率，最终反而可能更划算。\n模型性价比的衡量单位正在发生变化——不只看 token 单价，还有完成单个任务所需的成本。\n过去一年，国内模型公司普遍转向 MoE 和稀疏激活，也可以放在这一框架下理解。\nDeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B；Qwen3-235B-A22B 是 235B 总参数、22B 激活；Kimi K2.6 是 1T 总参数、32B 激活。近期发布的腾讯混元 Hy3 正式版，也采用 MoE 架构，295B 总参数、21B 激活参数，并支持 256K 上下文。\n国产大模型集体押注“大参数 + 小激活”，这说明模型能力与调用成本之间的关系，正在被重新设计。\n总参数决定模型的能力池有多大，能覆盖多少知识、推理、代码和 Agent 任务；激活参数决定一次推理真正要支付多少计算成本。MoE 的关键价值正在于此：\n让模型拥有接近超大规模模型的能力边界，同时让每次调用不必承担全量参数的计算开销。\n换句话说，性价比已经前置到模型架构设计阶段，而不再只是模型发布后的定价策略。\n腾讯混元 Hy3 正式版，正是这一趋势的近期样本。它的看点不只是 295B 总参数，更在于用 21B 激活参数承接一个更大的能力池，并将能力重点放在 Agent、办公、知识处理、多文件生成等真实任务上。\n此外，Hy3 正式版智能水平显著强于同尺寸模型，效果可比肩参数规模为其 2—5 倍的旗舰模型。这意味着，Hy3 能用更少的实际激活计算，承接更复杂的任务类型。\n从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，也说明模型经济性开始被真实调用规模检验。\n对国产模型厂商来说，性价比不只体现在开源和 API 价格上，更体现在能否在真实产品和开发者调用中，以更低成本支撑更多任务。\n因此，这一轮性价比竞争，本质上正在变成“单任务经济性”的竞争。\n未来模型公司比拼的，不只是能力池有多大，更是每个任务实际要为这座能力池支付多少成本。谁能用更少计算、更少轮次、更少重试，完成更多真实任务，谁才真正拥有更高的性价比。\n3、“默认调用”之争，大模型迎来“杰文斯时刻”\n当性价比的衡量单位转向“单任务成本”，模型竞争的重心也随之改变。企业和开发者真正关心的，正在从“哪个模型最强”，转向“哪个模型能被长期、稳定、低成本地默认调用”。\n所谓默认调用，指的是模型在办公、知识管理、Agent、客服、代码等高频场景中，系统优先调用的底层能力。它未必总被用户看见，却会持续承接大量真实任务。\n这种变化，已经开始被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router，本质上都在把模型调用从“手动选择”，推进到“统一调度”：系统根据任务复杂度、成本、延迟和性能，将请求路由到更合适的模型。\n开发者生态中的 OpenRouter、LiteLLM、Dify，也在承担类似角色。统一 API、多模型路由、预算控制，以及推理模型等默认能力配置，正在把模型嵌入更上层的应用框架和企业 AI 网关。\n这会重塑模型市场的竞争方式。未来，很多调用未必由终端用户直接决定，而会由云平台、AI 网关、开发框架和企业中台提前分配。谁能进入这些系统的默认配置，谁就能获得更高比例的真实调用。\n默认调用的第一重价值，是规模。一个模型只要能承接企业和开发者每天稳定发生的大量任务，即便单次调用价格不高，也能形成更扎实的商业基本盘。\n规模还会带来反馈。真实任务中的失败率、重试率、用户修正、工具调用路径、上下文组织方式，都会反过来帮助模型和系统优化。模型的进化，离不开静态评测，更离不开真实使用中的暴露、修正与迭代。\n更关键的是，默认调用会带来生态绑定。开发者一旦围绕某个模型调好了提示词、工具调用、RAG 流程、Agent 框架、评测标准和安全策略，这个模型就会从一个可替换的 API，变成应用架构的一部分。\n由此，“性价比”会形成一个新的竞争飞轮：更低单任务成本，带来更多默认调用；更多默认调用，带来更大调用规模和更多真实反馈；真实反馈继续推动模型和系统优化，进一步降低单任务成本。\n腾讯混元 Hy3 与 WorkBuddy 的结合，体现了这一趋势。WorkBuddy 承接企业办公、文件处理、流程编排等高频任务，Hy3 则通过这一入口进入真实工作流。\n公开信息显示，从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，WorkBuddy 上自主选择 Hy3 preview 的用户数增长 6 倍；正式版在办公场景内部测评中，任务成功率从 72% 提升至 90%，平均耗时缩短约 34%。\n这说明模型开始被真实任务链路反复检验。任务规划、工具调度、多 Agent 协作等能力，只有进入办公场景，才会暴露出失败、重试、耗时和工具调用等具体问题，并反过来推动模型迭代。\n类似的协同优化，已经成为行业共同方向。\nGoogle 将 Gemini 深度嵌入 Gmail、Docs 等工作场景，围绕邮件、文档、会议纪要等高频任务优化；Adobe Firefly 也嵌入 Photoshop、Illustrator、Premiere 等创意工作流，让模型围绕真实编辑、生成和修改链路迭代。\n模型只有进入真实任务，才能获得稳定调用、真实反馈和持续优化空间，最终形成“模型—产品—场景”的协同优化。\n因此，性价比竞争已经超出降价竞赛本身。它真正改变的，是需求边界。\n19 世纪，经济学家杰文斯观察到一个现象：蒸汽机效率越高，煤炭消耗反而越多。效率提升没有抑制使用，反而降低了使用门槛，让煤炭进入更多产业、更多机器和更长的生产链条。\n大模型正在接近自己的“杰文斯时刻”。\n性价比竞争的结果，未必是 AI 总成本下降，而是 AI 使用密度上升。模型调用会从少数高价值任务，扩展到大量日常任务，最终让 AI 变得更实用，也更普惠。\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 4675 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1SMR3L705118O92.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4675 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4675,"summary_length":4675,"usable_text_length":4675,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4675,"summary_length":4675}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"AI 大厂集体转向，大模型迎来“杰文斯时刻” - 手机网易网","url":"https://www.163.com/dy/article/L1SMR3L705118O92.html","summary":"文 | 深流研究所，作者 | 绛枫\n过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。\n比发布密度更值得注意的，是这些公司对模型的新叙事。\n最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。\n同样的转向，也在另外两家发生。\nOpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic 则说，Sonnet 5 能完成的智能体任务，在几个月前还需要更大、更贵的模型。\n当“更便宜”成了行业默认动作，真正的竞争就不再是“降多少价”，而是同样的价格，谁的模型能干更多、更难的任务？\n性价比，开始成为竞争的核心变量。\n1、性价比之争，模型公司重新组合能力、成本与场景\n这种变化首先体现在模型产品本身。模型公司开始把不同能力、不同成本和不同调用方式重新组合起来。\nOpenAI 的 GPT-5.6 最典型。“Sol / Terra / Luna”取代了过去几年“旗舰 + mini/nano”的模型命名体系。这改变了模型分层的逻辑——以前按强弱排序，现在按场景分工。\nSol 承担复杂推理、编程和 Agent 等高难任务，但价格与 GPT-5.5 标准旗舰持平；Terra 的综合表现接近 GPT-5.5，却落在 GPT-5.4 的中端价格区间；Luna 与开源 GLM-5.2 处在同一价位，主打高并发、低延迟的走量调用。\n这套分层的核心，是让能力跟着场景走、成本跟着任务变。复杂任务用旗舰能力，日常任务用主力模型，高频调用优先低延迟和低成本。\nOpenAI 今年 3 月推出Standard / Batch / Flex / Priority 定价机制，进一步把这种思路推进到调用层面。同一个模型，也可以按调用方式定价。能批处理、可等待的请求更便宜；追求低延迟、高确定性的请求更贵。\n这意味着，价格不再只取决于模型能力，也取决于任务对时间和稳定性的要求。过去隐藏在系统调度里的延迟、优先级和确定性，正在被直接写进计费结构。\n6 月底，Anthropic 发布 Claude Sonnet 5 同样指向这一趋势。Sonnet 5 内置了 effort 机制。它让调用方可以根据任务复杂度调节推理强度——中等 effort 用来控制成本，高 effort 才逼近旗舰表现。\n这打破了“选定模型就锁定成本”的旧逻辑。开发者不再只是选择用哪个模型，也可以决定一次调用投入多少算力。性价比因此从静态参数，变成了动态调节。\n7 月 9 日发布的 Grok 4.5，则把性价比前置到了训练阶段：先锁定高频场景，再围绕场景定义模型能力和成本结构。\nGrok 4.5 是 xAI 首个专门针对编程和智能体任务训练的模型，与 Cursor 联合训练，使用了 Cursor 上大量真实交互数据。定价为每百万 token 2 美元输入、6 美元输出，同时提供 MoE 架构、500K 上下文和可配置推理强度。\n编程和 Agent 往往上下文长、调用频繁、链路复杂，一次失败还会触发多轮重试，成本最容易被放大。Grok 4.5 选择先锁定 Cursor 这样的高频入口，再围绕真实调用优化能力和成本。\n这三款模型共同说明，性价比已经不再是一个简单的价格标签。OpenAI 是把不同能力放进不同调用场景；Anthropic 是把旗舰能力压进主力价格区间，并开放推理强度调节；Grok 则是在高频编程场景里重新计算“划算”的标准。\n大模型竞争正在从“能力最大化”转向“有效能力的成本最优化”。\n2、性价比的经济账，从“token 单价”到“单任务成本”\n不同于传统互联网 App，AI 产品每一次调用，都对应一次真实的推理成本。使用越多，价值越大，成本压力也越真实。\n模型竞争进入应用阶段，性价比正在从“价格问题”，延伸为“商业模式问题”。当模型真正进入真实任务场景，决定商业可持续性的，是模型能力能不能在高频调用中，被稳定、低成本地交付出来。\n一个真实任务的成本，通常由一整条任务链路共同决定：输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等，都会被计入最终账本。\n这也带来一个反直觉结论：定价便宜的模型，未必真的便宜。\n如果单次 token 价格低，却需要更多轮对话、更长上下文、更高重试率，那么单位任务成本未必低。反过来，一个看似更贵的模型，如果能用更少轮次完成任务，减少返工、降低失败率，最终反而可能更划算。\n模型性价比的衡量单位正在发生变化——不只看 token 单价，还有完成单个任务所需的成本。\n过去一年，国内模型公司普遍转向 MoE 和稀疏激活，也可以放在这一框架下理解。\nDeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B；Qwen3-235B-A22B 是 235B 总参数、22B 激活；Kimi K2.6 是 1T 总参数、32B 激活。近期发布的腾讯混元 Hy3 正式版，也采用 MoE 架构，295B 总参数、21B 激活参数，并支持 256K 上下文。\n国产大模型集体押注“大参数 + 小激活”，这说明模型能力与调用成本之间的关系，正在被重新设计。\n总参数决定模型的能力池有多大，能覆盖多少知识、推理、代码和 Agent 任务；激活参数决定一次推理真正要支付多少计算成本。MoE 的关键价值正在于此：\n让模型拥有接近超大规模模型的能力边界，同时让每次调用不必承担全量参数的计算开销。\n换句话说，性价比已经前置到模型架构设计阶段，而不再只是模型发布后的定价策略。\n腾讯混元 Hy3 正式版，正是这一趋势的近期样本。它的看点不只是 295B 总参数，更在于用 21B 激活参数承接一个更大的能力池，并将能力重点放在 Agent、办公、知识处理、多文件生成等真实任务上。\n此外，Hy3 正式版智能水平显著强于同尺寸模型，效果可比肩参数规模为其 2—5 倍的旗舰模型。这意味着，Hy3 能用更少的实际激活计算，承接更复杂的任务类型。\n从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，也说明模型经济性开始被真实调用规模检验。\n对国产模型厂商来说，性价比不只体现在开源和 API 价格上，更体现在能否在真实产品和开发者调用中，以更低成本支撑更多任务。\n因此，这一轮性价比竞争，本质上正在变成“单任务经济性”的竞争。\n未来模型公司比拼的，不只是能力池有多大，更是每个任务实际要为这座能力池支付多少成本。谁能用更少计算、更少轮次、更少重试，完成更多真实任务，谁才真正拥有更高的性价比。\n3、“默认调用”之争，大模型迎来“杰文斯时刻”\n当性价比的衡量单位转向“单任务成本”，模型竞争的重心也随之改变。企业和开发者真正关心的，正在从“哪个模型最强”，转向“哪个模型能被长期、稳定、低成本地默认调用”。\n所谓默认调用，指的是模型在办公、知识管理、Agent、客服、代码等高频场景中，系统优先调用的底层能力。它未必总被用户看见，却会持续承接大量真实任务。\n这种变化，已经开始被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router，本质上都在把模型调用从“手动选择”，推进到“统一调度”：系统根据任务复杂度、成本、延迟和性能，将请求路由到更合适的模型。\n开发者生态中的 OpenRouter、LiteLLM、Dify，也在承担类似角色。统一 API、多模型路由、预算控制，以及推理模型等默认能力配置，正在把模型嵌入更上层的应用框架和企业 AI 网关。\n这会重塑模型市场的竞争方式。未来，很多调用未必由终端用户直接决定，而会由云平台、AI 网关、开发框架和企业中台提前分配。谁能进入这些系统的默认配置，谁就能获得更高比例的真实调用。\n默认调用的第一重价值，是规模。一个模型只要能承接企业和开发者每天稳定发生的大量任务，即便单次调用价格不高，也能形成更扎实的商业基本盘。\n规模还会带来反馈。真实任务中的失败率、重试率、用户修正、工具调用路径、上下文组织方式，都会反过来帮助模型和系统优化。模型的进化，离不开静态评测，更离不开真实使用中的暴露、修正与迭代。\n更关键的是，默认调用会带来生态绑定。开发者一旦围绕某个模型调好了提示词、工具调用、RAG 流程、Agent 框架、评测标准和安全策略，这个模型就会从一个可替换的 API，变成应用架构的一部分。\n由此，“性价比”会形成一个新的竞争飞轮：更低单任务成本，带来更多默认调用；更多默认调用，带来更大调用规模和更多真实反馈；真实反馈继续推动模型和系统优化，进一步降低单任务成本。\n腾讯混元 Hy3 与 WorkBuddy 的结合，体现了这一趋势。WorkBuddy 承接企业办公、文件处理、流程编排等高频任务，Hy3 则通过这一入口进入真实工作流。\n公开信息显示，从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，WorkBuddy 上自主选择 Hy3 preview 的用户数增长 6 倍；正式版在办公场景内部测评中，任务成功率从 72% 提升至 90%，平均耗时缩短约 34%。\n这说明模型开始被真实任务链路反复检验。任务规划、工具调度、多 Agent 协作等能力，只有进入办公场景，才会暴露出失败、重试、耗时和工具调用等具体问题，并反过来推动模型迭代。\n类似的协同优化，已经成为行业共同方向。\nGoogle 将 Gemini 深度嵌入 Gmail、Docs 等工作场景，围绕邮件、文档、会议纪要等高频任务优化；Adobe Firefly 也嵌入 Photoshop、Illustrator、Premiere 等创意工作流，让模型围绕真实编辑、生成和修改链路迭代。\n模型只有进入真实任务，才能获得稳定调用、真实反馈和持续优化空间，最终形成“模型—产品—场景”的协同优化。\n因此，性价比竞争已经超出降价竞赛本身。它真正改变的，是需求边界。\n19 世纪，经济学家杰文斯观察到一个现象：蒸汽机效率越高，煤炭消耗反而越多。效率提升没有抑制使用，反而降低了使用门槛，让煤炭进入更多产业、更多机器和更长的生产链条。\n大模型正在接近自己的“杰文斯时刻”。\n性价比竞争的结果，未必是 AI 总成本下降，而是 AI 使用密度上升。模型调用会从少数高价值任务，扩展到大量日常任务，最终让 AI 变得更实用，也更普惠。\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","source":"手机网易网","date":"2026-07-15T05:02:08+00:00","content":"文 | 深流研究所，作者 | 绛枫\n过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。\n比发布密度更值得注意的，是这些公司对模型的新叙事。\n最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。\n同样的转向，也在另外两家发生。\nOpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic 则说，Sonnet 5 能完成的智能体任务，在几个月前还需要更大、更贵的模型。\n当“更便宜”成了行业默认动作，真正的竞争就不再是“降多少价”，而是同样的价格，谁的模型能干更多、更难的任务？\n性价比，开始成为竞争的核心变量。\n1、性价比之争，模型公司重新组合能力、成本与场景\n这种变化首先体现在模型产品本身。模型公司开始把不同能力、不同成本和不同调用方式重新组合起来。\nOpenAI 的 GPT-5.6 最典型。“Sol / Terra / Luna”取代了过去几年“旗舰 + mini/nano”的模型命名体系。这改变了模型分层的逻辑——以前按强弱排序，现在按场景分工。\nSol 承担复杂推理、编程和 Agent 等高难任务，但价格与 GPT-5.5 标准旗舰持平；Terra 的综合表现接近 GPT-5.5，却落在 GPT-5.4 的中端价格区间；Luna 与开源 GLM-5.2 处在同一价位，主打高并发、低延迟的走量调用。\n这套分层的核心，是让能力跟着场景走、成本跟着任务变。复杂任务用旗舰能力，日常任务用主力模型，高频调用优先低延迟和低成本。\nOpenAI 今年 3 月推出Standard / Batch / Flex / Priority 定价机制，进一步把这种思路推进到调用层面。同一个模型，也可以按调用方式定价。能批处理、可等待的请求更便宜；追求低延迟、高确定性的请求更贵。\n这意味着，价格不再只取决于模型能力，也取决于任务对时间和稳定性的要求。过去隐藏在系统调度里的延迟、优先级和确定性，正在被直接写进计费结构。\n6 月底，Anthropic 发布 Claude Sonnet 5 同样指向这一趋势。Sonnet 5 内置了 effort 机制。它让调用方可以根据任务复杂度调节推理强度——中等 effort 用来控制成本，高 effort 才逼近旗舰表现。\n这打破了“选定模型就锁定成本”的旧逻辑。开发者不再只是选择用哪个模型，也可以决定一次调用投入多少算力。性价比因此从静态参数，变成了动态调节。\n7 月 9 日发布的 Grok 4.5，则把性价比前置到了训练阶段：先锁定高频场景，再围绕场景定义模型能力和成本结构。\nGrok 4.5 是 xAI 首个专门针对编程和智能体任务训练的模型，与 Cursor 联合训练，使用了 Cursor 上大量真实交互数据。定价为每百万 token 2 美元输入、6 美元输出，同时提供 MoE 架构、500K 上下文和可配置推理强度。\n编程和 Agent 往往上下文长、调用频繁、链路复杂，一次失败还会触发多轮重试，成本最容易被放大。Grok 4.5 选择先锁定 Cursor 这样的高频入口，再围绕真实调用优化能力和成本。\n这三款模型共同说明，性价比已经不再是一个简单的价格标签。OpenAI 是把不同能力放进不同调用场景；Anthropic 是把旗舰能力压进主力价格区间，并开放推理强度调节；Grok 则是在高频编程场景里重新计算“划算”的标准。\n大模型竞争正在从“能力最大化”转向“有效能力的成本最优化”。\n2、性价比的经济账，从“token 单价”到“单任务成本”\n不同于传统互联网 App，AI 产品每一次调用，都对应一次真实的推理成本。使用越多，价值越大，成本压力也越真实。\n模型竞争进入应用阶段，性价比正在从“价格问题”，延伸为“商业模式问题”。当模型真正进入真实任务场景，决定商业可持续性的，是模型能力能不能在高频调用中，被稳定、低成本地交付出来。\n一个真实任务的成本，通常由一整条任务链路共同决定：输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等，都会被计入最终账本。\n这也带来一个反直觉结论：定价便宜的模型，未必真的便宜。\n如果单次 token 价格低，却需要更多轮对话、更长上下文、更高重试率，那么单位任务成本未必低。反过来，一个看似更贵的模型，如果能用更少轮次完成任务，减少返工、降低失败率，最终反而可能更划算。\n模型性价比的衡量单位正在发生变化——不只看 token 单价，还有完成单个任务所需的成本。\n过去一年，国内模型公司普遍转向 MoE 和稀疏激活，也可以放在这一框架下理解。\nDeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B；Qwen3-235B-A22B 是 235B 总参数、22B 激活；Kimi K2.6 是 1T 总参数、32B 激活。近期发布的腾讯混元 Hy3 正式版，也采用 MoE 架构，295B 总参数、21B 激活参数，并支持 256K 上下文。\n国产大模型集体押注“大参数 + 小激活”，这说明模型能力与调用成本之间的关系，正在被重新设计。\n总参数决定模型的能力池有多大，能覆盖多少知识、推理、代码和 Agent 任务；激活参数决定一次推理真正要支付多少计算成本。MoE 的关键价值正在于此：\n让模型拥有接近超大规模模型的能力边界，同时让每次调用不必承担全量参数的计算开销。\n换句话说，性价比已经前置到模型架构设计阶段，而不再只是模型发布后的定价策略。\n腾讯混元 Hy3 正式版，正是这一趋势的近期样本。它的看点不只是 295B 总参数，更在于用 21B 激活参数承接一个更大的能力池，并将能力重点放在 Agent、办公、知识处理、多文件生成等真实任务上。\n此外，Hy3 正式版智能水平显著强于同尺寸模型，效果可比肩参数规模为其 2—5 倍的旗舰模型。这意味着，Hy3 能用更少的实际激活计算，承接更复杂的任务类型。\n从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，也说明模型经济性开始被真实调用规模检验。\n对国产模型厂商来说，性价比不只体现在开源和 API 价格上，更体现在能否在真实产品和开发者调用中，以更低成本支撑更多任务。\n因此，这一轮性价比竞争，本质上正在变成“单任务经济性”的竞争。\n未来模型公司比拼的，不只是能力池有多大，更是每个任务实际要为这座能力池支付多少成本。谁能用更少计算、更少轮次、更少重试，完成更多真实任务，谁才真正拥有更高的性价比。\n3、“默认调用”之争，大模型迎来“杰文斯时刻”\n当性价比的衡量单位转向“单任务成本”，模型竞争的重心也随之改变。企业和开发者真正关心的，正在从“哪个模型最强”，转向“哪个模型能被长期、稳定、低成本地默认调用”。\n所谓默认调用，指的是模型在办公、知识管理、Agent、客服、代码等高频场景中，系统优先调用的底层能力。它未必总被用户看见，却会持续承接大量真实任务。\n这种变化，已经开始被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router，本质上都在把模型调用从“手动选择”，推进到“统一调度”：系统根据任务复杂度、成本、延迟和性能，将请求路由到更合适的模型。\n开发者生态中的 OpenRouter、LiteLLM、Dify，也在承担类似角色。统一 API、多模型路由、预算控制，以及推理模型等默认能力配置，正在把模型嵌入更上层的应用框架和企业 AI 网关。\n这会重塑模型市场的竞争方式。未来，很多调用未必由终端用户直接决定，而会由云平台、AI 网关、开发框架和企业中台提前分配。谁能进入这些系统的默认配置，谁就能获得更高比例的真实调用。\n默认调用的第一重价值，是规模。一个模型只要能承接企业和开发者每天稳定发生的大量任务，即便单次调用价格不高，也能形成更扎实的商业基本盘。\n规模还会带来反馈。真实任务中的失败率、重试率、用户修正、工具调用路径、上下文组织方式，都会反过来帮助模型和系统优化。模型的进化，离不开静态评测，更离不开真实使用中的暴露、修正与迭代。\n更关键的是，默认调用会带来生态绑定。开发者一旦围绕某个模型调好了提示词、工具调用、RAG 流程、Agent 框架、评测标准和安全策略，这个模型就会从一个可替换的 API，变成应用架构的一部分。\n由此，“性价比”会形成一个新的竞争飞轮：更低单任务成本，带来更多默认调用；更多默认调用，带来更大调用规模和更多真实反馈；真实反馈继续推动模型和系统优化，进一步降低单任务成本。\n腾讯混元 Hy3 与 WorkBuddy 的结合，体现了这一趋势。WorkBuddy 承接企业办公、文件处理、流程编排等高频任务，Hy3 则通过这一入口进入真实工作流。\n公开信息显示，从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，WorkBuddy 上自主选择 Hy3 preview 的用户数增长 6 倍；正式版在办公场景内部测评中，任务成功率从 72% 提升至 90%，平均耗时缩短约 34%。\n这说明模型开始被真实任务链路反复检验。任务规划、工具调度、多 Agent 协作等能力，只有进入办公场景，才会暴露出失败、重试、耗时和工具调用等具体问题，并反过来推动模型迭代。\n类似的协同优化，已经成为行业共同方向。\nGoogle 将 Gemini 深度嵌入 Gmail、Docs 等工作场景，围绕邮件、文档、会议纪要等高频任务优化；Adobe Firefly 也嵌入 Photoshop、Illustrator、Premiere 等创意工作流，让模型围绕真实编辑、生成和修改链路迭代。\n模型只有进入真实任务，才能获得稳定调用、真实反馈和持续优化空间，最终形成“模型—产品—场景”的协同优化。\n因此，性价比竞争已经超出降价竞赛本身。它真正改变的，是需求边界。\n19 世纪，经济学家杰文斯观察到一个现象：蒸汽机效率越高，煤炭消耗反而越多。效率提升没有抑制使用，反而降低了使用门槛，让煤炭进入更多产业、更多机器和更长的生产链条。\n大模型正在接近自己的“杰文斯时刻”。\n性价比竞争的结果，未必是 AI 总成本下降，而是 AI 使用密度上升。模型调用会从少数高价值任务，扩展到大量日常任务，最终让 AI 变得更实用，也更普惠。\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1SMR3L705118O92.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 4675 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4675 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4675,"summary_length":4675,"usable_text_length":4675,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4675,"summary_length":4675}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/37052","export_markdown":"/api/items/37052/export?format=markdown","export_json":"/api/items/37052/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1SMR3L705118O92.html"},"formats":{"full":{"id":37052,"title":"AI 大厂集体转向，大模型迎来“杰文斯时刻” - 手机网易网","url":"https://www.163.com/dy/article/L1SMR3L705118O92.html","source":"手机网易网","author":null,"published_at":"2026-07-15T05:02:08+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"文 | 深流研究所，作者 | 绛枫\n过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。\n比发布密度更值得注意的，是这些公司对模型的新叙事。\n最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。\n同样的转向，也在另外两家发生。\nOpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic 则说，Sonnet 5 能完成的智能体任务，在几个月前还需要更大、更贵的模型。\n当“更便宜”成了行业默认动作，真正的竞争就不再是“降多少价”，而是同样的价格，谁的模型能干更多、更难的任务？\n性价比，开始成为竞争的核心变量。\n1、性价比之争，模型公司重新组合能力、成本与场景\n这种变化首先体现在模型产品本身。模型公司开始把不同能力、不同成本和不同调用方式重新组合起来。\nOpenAI 的 GPT-5.6 最典型。“Sol / Terra / Luna”取代了过去几年“旗舰 + mini/nano”的模型命名体系。这改变了模型分层的逻辑——以前按强弱排序，现在按场景分工。\nSol 承担复杂推理、编程和 Agent 等高难任务，但价格与 GPT-5.5 标准旗舰持平；Terra 的综合表现接近 GPT-5.5，却落在 GPT-5.4 的中端价格区间；Luna 与开源 GLM-5.2 处在同一价位，主打高并发、低延迟的走量调用。\n这套分层的核心，是让能力跟着场景走、成本跟着任务变。复杂任务用旗舰能力，日常任务用主力模型，高频调用优先低延迟和低成本。\nOpenAI 今年 3 月推出Standard / Batch / Flex / Priority 定价机制，进一步把这种思路推进到调用层面。同一个模型，也可以按调用方式定价。能批处理、可等待的请求更便宜；追求低延迟、高确定性的请求更贵。\n这意味着，价格不再只取决于模型能力，也取决于任务对时间和稳定性的要求。过去隐藏在系统调度里的延迟、优先级和确定性，正在被直接写进计费结构。\n6 月底，Anthropic 发布 Claude Sonnet 5 同样指向这一趋势。Sonnet 5 内置了 effort 机制。它让调用方可以根据任务复杂度调节推理强度——中等 effort 用来控制成本，高 effort 才逼近旗舰表现。\n这打破了“选定模型就锁定成本”的旧逻辑。开发者不再只是选择用哪个模型，也可以决定一次调用投入多少算力。性价比因此从静态参数，变成了动态调节。\n7 月 9 日发布的 Grok 4.5，则把性价比前置到了训练阶段：先锁定高频场景，再围绕场景定义模型能力和成本结构。\nGrok 4.5 是 xAI 首个专门针对编程和智能体任务训练的模型，与 Cursor 联合训练，使用了 Cursor 上大量真实交互数据。定价为每百万 token 2 美元输入、6 美元输出，同时提供 MoE 架构、500K 上下文和可配置推理强度。\n编程和 Agent 往往上下文长、调用频繁、链路复杂，一次失败还会触发多轮重试，成本最容易被放大。Grok 4.5 选择先锁定 Cursor 这样的高频入口，再围绕真实调用优化能力和成本。\n这三款模型共同说明，性价比已经不再是一个简单的价格标签。OpenAI 是把不同能力放进不同调用场景；Anthropic 是把旗舰能力压进主力价格区间，并开放推理强度调节；Grok 则是在高频编程场景里重新计算“划算”的标准。\n大模型竞争正在从“能力最大化”转向“有效能力的成本最优化”。\n2、性价比的经济账，从“token 单价”到“单任务成本”\n不同于传统互联网 App，AI 产品每一次调用，都对应一次真实的推理成本。使用越多，价值越大，成本压力也越真实。\n模型竞争进入应用阶段，性价比正在从“价格问题”，延伸为“商业模式问题”。当模型真正进入真实任务场景，决定商业可持续性的，是模型能力能不能在高频调用中，被稳定、低成本地交付出来。\n一个真实任务的成本，通常由一整条任务链路共同决定：输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等，都会被计入最终账本。\n这也带来一个反直觉结论：定价便宜的模型，未必真的便宜。\n如果单次 token 价格低，却需要更多轮对话、更长上下文、更高重试率，那么单位任务成本未必低。反过来，一个看似更贵的模型，如果能用更少轮次完成任务，减少返工、降低失败率，最终反而可能更划算。\n模型性价比的衡量单位正在发生变化——不只看 token 单价，还有完成单个任务所需的成本。\n过去一年，国内模型公司普遍转向 MoE 和稀疏激活，也可以放在这一框架下理解。\nDeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B；Qwen3-235B-A22B 是 235B 总参数、22B 激活；Kimi K2.6 是 1T 总参数、32B 激活。近期发布的腾讯混元 Hy3 正式版，也采用 MoE 架构，295B 总参数、21B 激活参数，并支持 256K 上下文。\n国产大模型集体押注“大参数 + 小激活”，这说明模型能力与调用成本之间的关系，正在被重新设计。\n总参数决定模型的能力池有多大，能覆盖多少知识、推理、代码和 Agent 任务；激活参数决定一次推理真正要支付多少计算成本。MoE 的关键价值正在于此：\n让模型拥有接近超大规模模型的能力边界，同时让每次调用不必承担全量参数的计算开销。\n换句话说，性价比已经前置到模型架构设计阶段，而不再只是模型发布后的定价策略。\n腾讯混元 Hy3 正式版，正是这一趋势的近期样本。它的看点不只是 295B 总参数，更在于用 21B 激活参数承接一个更大的能力池，并将能力重点放在 Agent、办公、知识处理、多文件生成等真实任务上。\n此外，Hy3 正式版智能水平显著强于同尺寸模型，效果可比肩参数规模为其 2—5 倍的旗舰模型。这意味着，Hy3 能用更少的实际激活计算，承接更复杂的任务类型。\n从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，也说明模型经济性开始被真实调用规模检验。\n对国产模型厂商来说，性价比不只体现在开源和 API 价格上，更体现在能否在真实产品和开发者调用中，以更低成本支撑更多任务。\n因此，这一轮性价比竞争，本质上正在变成“单任务经济性”的竞争。\n未来模型公司比拼的，不只是能力池有多大，更是每个任务实际要为这座能力池支付多少成本。谁能用更少计算、更少轮次、更少重试，完成更多真实任务，谁才真正拥有更高的性价比。\n3、“默认调用”之争，大模型迎来“杰文斯时刻”\n当性价比的衡量单位转向“单任务成本”，模型竞争的重心也随之改变。企业和开发者真正关心的，正在从“哪个模型最强”，转向“哪个模型能被长期、稳定、低成本地默认调用”。\n所谓默认调用，指的是模型在办公、知识管理、Agent、客服、代码等高频场景中，系统优先调用的底层能力。它未必总被用户看见，却会持续承接大量真实任务。\n这种变化，已经开始被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router，本质上都在把模型调用从“手动选择”，推进到“统一调度”：系统根据任务复杂度、成本、延迟和性能，将请求路由到更合适的模型。\n开发者生态中的 OpenRouter、LiteLLM、Dify，也在承担类似角色。统一 API、多模型路由、预算控制，以及推理模型等默认能力配置，正在把模型嵌入更上层的应用框架和企业 AI 网关。\n这会重塑模型市场的竞争方式。未来，很多调用未必由终端用户直接决定，而会由云平台、AI 网关、开发框架和企业中台提前分配。谁能进入这些系统的默认配置，谁就能获得更高比例的真实调用。\n默认调用的第一重价值，是规模。一个模型只要能承接企业和开发者每天稳定发生的大量任务，即便单次调用价格不高，也能形成更扎实的商业基本盘。\n规模还会带来反馈。真实任务中的失败率、重试率、用户修正、工具调用路径、上下文组织方式，都会反过来帮助模型和系统优化。模型的进化，离不开静态评测，更离不开真实使用中的暴露、修正与迭代。\n更关键的是，默认调用会带来生态绑定。开发者一旦围绕某个模型调好了提示词、工具调用、RAG 流程、Agent 框架、评测标准和安全策略，这个模型就会从一个可替换的 API，变成应用架构的一部分。\n由此，“性价比”会形成一个新的竞争飞轮：更低单任务成本，带来更多默认调用；更多默认调用，带来更大调用规模和更多真实反馈；真实反馈继续推动模型和系统优化，进一步降低单任务成本。\n腾讯混元 Hy3 与 WorkBuddy 的结合，体现了这一趋势。WorkBuddy 承接企业办公、文件处理、流程编排等高频任务，Hy3 则通过这一入口进入真实工作流。\n公开信息显示，从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，WorkBuddy 上自主选择 Hy3 preview 的用户数增长 6 倍；正式版在办公场景内部测评中，任务成功率从 72% 提升至 90%，平均耗时缩短约 34%。\n这说明模型开始被真实任务链路反复检验。任务规划、工具调度、多 Agent 协作等能力，只有进入办公场景，才会暴露出失败、重试、耗时和工具调用等具体问题，并反过来推动模型迭代。\n类似的协同优化，已经成为行业共同方向。\nGoogle 将 Gemini 深度嵌入 Gmail、Docs 等工作场景，围绕邮件、文档、会议纪要等高频任务优化；Adobe Firefly 也嵌入 Photoshop、Illustrator、Premiere 等创意工作流，让模型围绕真实编辑、生成和修改链路迭代。\n模型只有进入真实任务，才能获得稳定调用、真实反馈和持续优化空间，最终形成“模型—产品—场景”的协同优化。\n因此，性价比竞争已经超出降价竞赛本身。它真正改变的，是需求边界。\n19 世纪，经济学家杰文斯观察到一个现象：蒸汽机效率越高，煤炭消耗反而越多。效率提升没有抑制使用，反而降低了使用门槛，让煤炭进入更多产业、更多机器和更长的生产链条。\n大模型正在接近自己的“杰文斯时刻”。\n性价比竞争的结果，未必是 AI 总成本下降，而是 AI 使用密度上升。模型调用会从少数高价值任务，扩展到大量日常任务，最终让 AI 变得更实用，也更普惠。\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","full_text":"文 | 深流研究所，作者 | 绛枫\n过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。\n比发布密度更值得注意的，是这些公司对模型的新叙事。\n最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。\n同样的转向，也在另外两家发生。\nOpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic 则说，Sonnet 5 能完成的智能体任务，在几个月前还需要更大、更贵的模型。\n当“更便宜”成了行业默认动作，真正的竞争就不再是“降多少价”，而是同样的价格，谁的模型能干更多、更难的任务？\n性价比，开始成为竞争的核心变量。\n1、性价比之争，模型公司重新组合能力、成本与场景\n这种变化首先体现在模型产品本身。模型公司开始把不同能力、不同成本和不同调用方式重新组合起来。\nOpenAI 的 GPT-5.6 最典型。“Sol / Terra / Luna”取代了过去几年“旗舰 + mini/nano”的模型命名体系。这改变了模型分层的逻辑——以前按强弱排序，现在按场景分工。\nSol 承担复杂推理、编程和 Agent 等高难任务，但价格与 GPT-5.5 标准旗舰持平；Terra 的综合表现接近 GPT-5.5，却落在 GPT-5.4 的中端价格区间；Luna 与开源 GLM-5.2 处在同一价位，主打高并发、低延迟的走量调用。\n这套分层的核心，是让能力跟着场景走、成本跟着任务变。复杂任务用旗舰能力，日常任务用主力模型，高频调用优先低延迟和低成本。\nOpenAI 今年 3 月推出Standard / Batch / Flex / Priority 定价机制，进一步把这种思路推进到调用层面。同一个模型，也可以按调用方式定价。能批处理、可等待的请求更便宜；追求低延迟、高确定性的请求更贵。\n这意味着，价格不再只取决于模型能力，也取决于任务对时间和稳定性的要求。过去隐藏在系统调度里的延迟、优先级和确定性，正在被直接写进计费结构。\n6 月底，Anthropic 发布 Claude Sonnet 5 同样指向这一趋势。Sonnet 5 内置了 effort 机制。它让调用方可以根据任务复杂度调节推理强度——中等 effort 用来控制成本，高 effort 才逼近旗舰表现。\n这打破了“选定模型就锁定成本”的旧逻辑。开发者不再只是选择用哪个模型，也可以决定一次调用投入多少算力。性价比因此从静态参数，变成了动态调节。\n7 月 9 日发布的 Grok 4.5，则把性价比前置到了训练阶段：先锁定高频场景，再围绕场景定义模型能力和成本结构。\nGrok 4.5 是 xAI 首个专门针对编程和智能体任务训练的模型，与 Cursor 联合训练，使用了 Cursor 上大量真实交互数据。定价为每百万 token 2 美元输入、6 美元输出，同时提供 MoE 架构、500K 上下文和可配置推理强度。\n编程和 Agent 往往上下文长、调用频繁、链路复杂，一次失败还会触发多轮重试，成本最容易被放大。Grok 4.5 选择先锁定 Cursor 这样的高频入口，再围绕真实调用优化能力和成本。\n这三款模型共同说明，性价比已经不再是一个简单的价格标签。OpenAI 是把不同能力放进不同调用场景；Anthropic 是把旗舰能力压进主力价格区间，并开放推理强度调节；Grok 则是在高频编程场景里重新计算“划算”的标准。\n大模型竞争正在从“能力最大化”转向“有效能力的成本最优化”。\n2、性价比的经济账，从“token 单价”到“单任务成本”\n不同于传统互联网 App，AI 产品每一次调用，都对应一次真实的推理成本。使用越多，价值越大，成本压力也越真实。\n模型竞争进入应用阶段，性价比正在从“价格问题”，延伸为“商业模式问题”。当模型真正进入真实任务场景，决定商业可持续性的，是模型能力能不能在高频调用中，被稳定、低成本地交付出来。\n一个真实任务的成本，通常由一整条任务链路共同决定：输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等，都会被计入最终账本。\n这也带来一个反直觉结论：定价便宜的模型，未必真的便宜。\n如果单次 token 价格低，却需要更多轮对话、更长上下文、更高重试率，那么单位任务成本未必低。反过来，一个看似更贵的模型，如果能用更少轮次完成任务，减少返工、降低失败率，最终反而可能更划算。\n模型性价比的衡量单位正在发生变化——不只看 token 单价，还有完成单个任务所需的成本。\n过去一年，国内模型公司普遍转向 MoE 和稀疏激活，也可以放在这一框架下理解。\nDeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B；Qwen3-235B-A22B 是 235B 总参数、22B 激活；Kimi K2.6 是 1T 总参数、32B 激活。近期发布的腾讯混元 Hy3 正式版，也采用 MoE 架构，295B 总参数、21B 激活参数，并支持 256K 上下文。\n国产大模型集体押注“大参数 + 小激活”，这说明模型能力与调用成本之间的关系，正在被重新设计。\n总参数决定模型的能力池有多大，能覆盖多少知识、推理、代码和 Agent 任务；激活参数决定一次推理真正要支付多少计算成本。MoE 的关键价值正在于此：\n让模型拥有接近超大规模模型的能力边界，同时让每次调用不必承担全量参数的计算开销。\n换句话说，性价比已经前置到模型架构设计阶段，而不再只是模型发布后的定价策略。\n腾讯混元 Hy3 正式版，正是这一趋势的近期样本。它的看点不只是 295B 总参数，更在于用 21B 激活参数承接一个更大的能力池，并将能力重点放在 Agent、办公、知识处理、多文件生成等真实任务上。\n此外，Hy3 正式版智能水平显著强于同尺寸模型，效果可比肩参数规模为其 2—5 倍的旗舰模型。这意味着，Hy3 能用更少的实际激活计算，承接更复杂的任务类型。\n从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，也说明模型经济性开始被真实调用规模检验。\n对国产模型厂商来说，性价比不只体现在开源和 API 价格上，更体现在能否在真实产品和开发者调用中，以更低成本支撑更多任务。\n因此，这一轮性价比竞争，本质上正在变成“单任务经济性”的竞争。\n未来模型公司比拼的，不只是能力池有多大，更是每个任务实际要为这座能力池支付多少成本。谁能用更少计算、更少轮次、更少重试，完成更多真实任务，谁才真正拥有更高的性价比。\n3、“默认调用”之争，大模型迎来“杰文斯时刻”\n当性价比的衡量单位转向“单任务成本”，模型竞争的重心也随之改变。企业和开发者真正关心的，正在从“哪个模型最强”，转向“哪个模型能被长期、稳定、低成本地默认调用”。\n所谓默认调用，指的是模型在办公、知识管理、Agent、客服、代码等高频场景中，系统优先调用的底层能力。它未必总被用户看见，却会持续承接大量真实任务。\n这种变化，已经开始被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router，本质上都在把模型调用从“手动选择”，推进到“统一调度”：系统根据任务复杂度、成本、延迟和性能，将请求路由到更合适的模型。\n开发者生态中的 OpenRouter、LiteLLM、Dify，也在承担类似角色。统一 API、多模型路由、预算控制，以及推理模型等默认能力配置，正在把模型嵌入更上层的应用框架和企业 AI 网关。\n这会重塑模型市场的竞争方式。未来，很多调用未必由终端用户直接决定，而会由云平台、AI 网关、开发框架和企业中台提前分配。谁能进入这些系统的默认配置，谁就能获得更高比例的真实调用。\n默认调用的第一重价值，是规模。一个模型只要能承接企业和开发者每天稳定发生的大量任务，即便单次调用价格不高，也能形成更扎实的商业基本盘。\n规模还会带来反馈。真实任务中的失败率、重试率、用户修正、工具调用路径、上下文组织方式，都会反过来帮助模型和系统优化。模型的进化，离不开静态评测，更离不开真实使用中的暴露、修正与迭代。\n更关键的是，默认调用会带来生态绑定。开发者一旦围绕某个模型调好了提示词、工具调用、RAG 流程、Agent 框架、评测标准和安全策略，这个模型就会从一个可替换的 API，变成应用架构的一部分。\n由此，“性价比”会形成一个新的竞争飞轮：更低单任务成本，带来更多默认调用；更多默认调用，带来更大调用规模和更多真实反馈；真实反馈继续推动模型和系统优化，进一步降低单任务成本。\n腾讯混元 Hy3 与 WorkBuddy 的结合，体现了这一趋势。WorkBuddy 承接企业办公、文件处理、流程编排等高频任务，Hy3 则通过这一入口进入真实工作流。\n公开信息显示，从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，WorkBuddy 上自主选择 Hy3 preview 的用户数增长 6 倍；正式版在办公场景内部测评中，任务成功率从 72% 提升至 90%，平均耗时缩短约 34%。\n这说明模型开始被真实任务链路反复检验。任务规划、工具调度、多 Agent 协作等能力，只有进入办公场景，才会暴露出失败、重试、耗时和工具调用等具体问题，并反过来推动模型迭代。\n类似的协同优化，已经成为行业共同方向。\nGoogle 将 Gemini 深度嵌入 Gmail、Docs 等工作场景，围绕邮件、文档、会议纪要等高频任务优化；Adobe Firefly 也嵌入 Photoshop、Illustrator、Premiere 等创意工作流，让模型围绕真实编辑、生成和修改链路迭代。\n模型只有进入真实任务，才能获得稳定调用、真实反馈和持续优化空间，最终形成“模型—产品—场景”的协同优化。\n因此，性价比竞争已经超出降价竞赛本身。它真正改变的，是需求边界。\n19 世纪，经济学家杰文斯观察到一个现象：蒸汽机效率越高，煤炭消耗反而越多。效率提升没有抑制使用，反而降低了使用门槛，让煤炭进入更多产业、更多机器和更长的生产链条。\n大模型正在接近自己的“杰文斯时刻”。\n性价比竞争的结果，未必是 AI 总成本下降，而是 AI 使用密度上升。模型调用会从少数高价值任务，扩展到大量日常任务，最终让 AI 变得更实用，也更普惠。\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","reading_time_min":2,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 4675 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1SMR3L705118O92.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4675 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4675,"summary_length":4675,"usable_text_length":4675,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4675,"summary_length":4675}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4675 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4675,"summary_length":4675,"usable_text_length":4675,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4675,"summary_length":4675}},"actions":{"read":"/item/37052","export_markdown":"/api/items/37052/export?format=markdown","export_json":"/api/items/37052/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1SMR3L705118O92.html"}},"digest":{"id":37052,"title":"AI 大厂集体转向，大模型迎来“杰文斯时刻” - 手机网易网","url":"https://www.163.com/dy/article/L1SMR3L705118O92.html","source":"手机网易网","topic":"ai","published_at":"2026-07-15T05:02:08+00:00","excerpt":"文 | 深流研究所，作者 | 绛枫 过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。 比发布密度更值得注意的，是这些公司对模型的新叙事。 最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。 同样的转向，也在另外两家发生。 OpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 4675 characters.","reading_time_min":2,"cluster_id":1774585},"card":{"display_title":"AI 大厂集体转向，大模型迎来“杰文斯时刻” - 手机网易网","subtitle":"手机网易网 · 2026-07-15","summary":"文 | 深流研究所，作者 | 绛枫 过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。 比发布密度更值得注意的，是这些公司对模型的新叙事。 最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。 同样的转向，也在另外两家发生。 OpenAI 把 GPT-5.6 的目标写成“让每个 token…","badges":["quality:high"],"links":{"read":"/item/37052","original":"https://www.163.com/dy/article/L1SMR3L705118O92.html","diagnose":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1SMR3L705118O92.html"},"quality_warning":null},"export":{"title":"AI 大厂集体转向，大模型迎来“杰文斯时刻” - 手机网易网","url":"https://www.163.com/dy/article/L1SMR3L705118O92.html","summary":"文 | 深流研究所，作者 | 绛枫\n过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。\n比发布密度更值得注意的，是这些公司对模型的新叙事。\n最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。\n同样的转向，也在另外两家发生。\nOpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic 则说，Sonnet 5 能完成的智能体任务，在几个月前还需要更大、更贵的模型。\n当“更便宜”成了行业默认动作，真正的竞争就不再是“降多少价”，而是同样的价格，谁的模型能干更多、更难的任务？\n性价比，开始成为竞争的核心变量。\n1、性价比之争，模型公司重新组合能力、成本与场景\n这种变化首先体现在模型产品本身。模型公司开始把不同能力、不同成本和不同调用方式重新组合起来。\nOpenAI 的 GPT-5.6 最典型。“Sol / Terra / Luna”取代了过去几年“旗舰 + mini/nano”的模型命名体系。这改变了模型分层的逻辑——以前按强弱排序，现在按场景分工。\nSol 承担复杂推理、编程和 Agent 等高难任务，但价格与 GPT-5.5 标准旗舰持平；Terra 的综合表现接近 GPT-5.5，却落在 GPT-5.4 的中端价格区间；Luna 与开源 GLM-5.2 处在同一价位，主打高并发、低延迟的走量调用。\n这套分层的核心，是让能力跟着场景走、成本跟着任务变。复杂任务用旗舰能力，日常任务用主力模型，高频调用优先低延迟和低成本。\nOpenAI 今年 3 月推出Standard / Batch / Flex / Priority 定价机制，进一步把这种思路推进到调用层面。同一个模型，也可以按调用方式定价。能批处理、可等待的请求更便宜；追求低延迟、高确定性的请求更贵。\n这意味着，价格不再只取决于模型能力，也取决于任务对时间和稳定性的要求。过去隐藏在系统调度里的延迟、优先级和确定性，正在被直接写进计费结构。\n6 月底，Anthropic 发布 Claude Sonnet 5 同样指向这一趋势。Sonnet 5 内置了 effort 机制。它让调用方可以根据任务复杂度调节推理强度——中等 effort 用来控制成本，高 effort 才逼近旗舰表现。\n这打破了“选定模型就锁定成本”的旧逻辑。开发者不再只是选择用哪个模型，也可以决定一次调用投入多少算力。性价比因此从静态参数，变成了动态调节。\n7 月 9 日发布的 Grok 4.5，则把性价比前置到了训练阶段：先锁定高频场景，再围绕场景定义模型能力和成本结构。\nGrok 4.5 是 xAI 首个专门针对编程和智能体任务训练的模型，与 Cursor 联合训练，使用了 Cursor 上大量真实交互数据。定价为每百万 token 2 美元输入、6 美元输出，同时提供 MoE 架构、500K 上下文和可配置推理强度。\n编程和 Agent 往往上下文长、调用频繁、链路复杂，一次失败还会触发多轮重试，成本最容易被放大。Grok 4.5 选择先锁定 Cursor 这样的高频入口，再围绕真实调用优化能力和成本。\n这三款模型共同说明，性价比已经不再是一个简单的价格标签。OpenAI 是把不同能力放进不同调用场景；Anthropic 是把旗舰能力压进主力价格区间，并开放推理强度调节；Grok 则是在高频编程场景里重新计算“划算”的标准。\n大模型竞争正在从“能力最大化”转向“有效能力的成本最优化”。\n2、性价比的经济账，从“token 单价”到“单任务成本”\n不同于传统互联网 App，AI 产品每一次调用，都对应一次真实的推理成本。使用越多，价值越大，成本压力也越真实。\n模型竞争进入应用阶段，性价比正在从“价格问题”，延伸为“商业模式问题”。当模型真正进入真实任务场景，决定商业可持续性的，是模型能力能不能在高频调用中，被稳定、低成本地交付出来。\n一个真实任务的成本，通常由一整条任务链路共同决定：输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等，都会被计入最终账本。\n这也带来一个反直觉结论：定价便宜的模型，未必真的便宜。\n如果单次 token 价格低，却需要更多轮对话、更长上下文、更高重试率，那么单位任务成本未必低。反过来，一个看似更贵的模型，如果能用更少轮次完成任务，减少返工、降低失败率，最终反而可能更划算。\n模型性价比的衡量单位正在发生变化——不只看 token 单价，还有完成单个任务所需的成本。\n过去一年，国内模型公司普遍转向 MoE 和稀疏激活，也可以放在这一框架下理解。\nDeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B；Qwen3-235B-A22B 是 235B 总参数、22B 激活；Kimi K2.6 是 1T 总参数、32B 激活。近期发布的腾讯混元 Hy3 正式版，也采用 MoE 架构，295B 总参数、21B 激活参数，并支持 256K 上下文。\n国产大模型集体押注“大参数 + 小激活”，这说明模型能力与调用成本之间的关系，正在被重新设计。\n总参数决定模型的能力池有多大，能覆盖多少知识、推理、代码和 Agent 任务；激活参数决定一次推理真正要支付多少计算成本。MoE 的关键价值正在于此：\n让模型拥有接近超大规模模型的能力边界，同时让每次调用不必承担全量参数的计算开销。\n换句话说，性价比已经前置到模型架构设计阶段，而不再只是模型发布后的定价策略。\n腾讯混元 Hy3 正式版，正是这一趋势的近期样本。它的看点不只是 295B 总参数，更在于用 21B 激活参数承接一个更大的能力池，并将能力重点放在 Agent、办公、知识处理、多文件生成等真实任务上。\n此外，Hy3 正式版智能水平显著强于同尺寸模型，效果可比肩参数规模为其 2—5 倍的旗舰模型。这意味着，Hy3 能用更少的实际激活计算，承接更复杂的任务类型。\n从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，也说明模型经济性开始被真实调用规模检验。\n对国产模型厂商来说，性价比不只体现在开源和 API 价格上，更体现在能否在真实产品和开发者调用中，以更低成本支撑更多任务。\n因此，这一轮性价比竞争，本质上正在变成“单任务经济性”的竞争。\n未来模型公司比拼的，不只是能力池有多大，更是每个任务实际要为这座能力池支付多少成本。谁能用更少计算、更少轮次、更少重试，完成更多真实任务，谁才真正拥有更高的性价比。\n3、“默认调用”之争，大模型迎来“杰文斯时刻”\n当性价比的衡量单位转向“单任务成本”，模型竞争的重心也随之改变。企业和开发者真正关心的，正在从“哪个模型最强”，转向“哪个模型能被长期、稳定、低成本地默认调用”。\n所谓默认调用，指的是模型在办公、知识管理、Agent、客服、代码等高频场景中，系统优先调用的底层能力。它未必总被用户看见，却会持续承接大量真实任务。\n这种变化，已经开始被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router，本质上都在把模型调用从“手动选择”，推进到“统一调度”：系统根据任务复杂度、成本、延迟和性能，将请求路由到更合适的模型。\n开发者生态中的 OpenRouter、LiteLLM、Dify，也在承担类似角色。统一 API、多模型路由、预算控制，以及推理模型等默认能力配置，正在把模型嵌入更上层的应用框架和企业 AI 网关。\n这会重塑模型市场的竞争方式。未来，很多调用未必由终端用户直接决定，而会由云平台、AI 网关、开发框架和企业中台提前分配。谁能进入这些系统的默认配置，谁就能获得更高比例的真实调用。\n默认调用的第一重价值，是规模。一个模型只要能承接企业和开发者每天稳定发生的大量任务，即便单次调用价格不高，也能形成更扎实的商业基本盘。\n规模还会带来反馈。真实任务中的失败率、重试率、用户修正、工具调用路径、上下文组织方式，都会反过来帮助模型和系统优化。模型的进化，离不开静态评测，更离不开真实使用中的暴露、修正与迭代。\n更关键的是，默认调用会带来生态绑定。开发者一旦围绕某个模型调好了提示词、工具调用、RAG 流程、Agent 框架、评测标准和安全策略，这个模型就会从一个可替换的 API，变成应用架构的一部分。\n由此，“性价比”会形成一个新的竞争飞轮：更低单任务成本，带来更多默认调用；更多默认调用，带来更大调用规模和更多真实反馈；真实反馈继续推动模型和系统优化，进一步降低单任务成本。\n腾讯混元 Hy3 与 WorkBuddy 的结合，体现了这一趋势。WorkBuddy 承接企业办公、文件处理、流程编排等高频任务，Hy3 则通过这一入口进入真实工作流。\n公开信息显示，从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，WorkBuddy 上自主选择 Hy3 preview 的用户数增长 6 倍；正式版在办公场景内部测评中，任务成功率从 72% 提升至 90%，平均耗时缩短约 34%。\n这说明模型开始被真实任务链路反复检验。任务规划、工具调度、多 Agent 协作等能力，只有进入办公场景，才会暴露出失败、重试、耗时和工具调用等具体问题，并反过来推动模型迭代。\n类似的协同优化，已经成为行业共同方向。\nGoogle 将 Gemini 深度嵌入 Gmail、Docs 等工作场景，围绕邮件、文档、会议纪要等高频任务优化；Adobe Firefly 也嵌入 Photoshop、Illustrator、Premiere 等创意工作流，让模型围绕真实编辑、生成和修改链路迭代。\n模型只有进入真实任务，才能获得稳定调用、真实反馈和持续优化空间，最终形成“模型—产品—场景”的协同优化。\n因此，性价比竞争已经超出降价竞赛本身。它真正改变的，是需求边界。\n19 世纪，经济学家杰文斯观察到一个现象：蒸汽机效率越高，煤炭消耗反而越多。效率提升没有抑制使用，反而降低了使用门槛，让煤炭进入更多产业、更多机器和更长的生产链条。\n大模型正在接近自己的“杰文斯时刻”。\n性价比竞争的结果，未必是 AI 总成本下降，而是 AI 使用密度上升。模型调用会从少数高价值任务，扩展到大量日常任务，最终让 AI 变得更实用，也更普惠。\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","source":"手机网易网","date":"2026-07-15T05:02:08+00:00","content":"文 | 深流研究所，作者 | 绛枫\n过去一周，Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。\n比发布密度更值得注意的，是这些公司对模型的新叙事。\n最典型的是马斯克。介绍 Grok 4.5 时，他几乎没提“xAI 最强”，而是反复强调一个点——“Opus 级模型”，但更快、更省 token、成本更低。\n同样的转向，也在另外两家发生。\nOpenAI 把 GPT-5.6 的目标写成“让每个 token 产出更多有用工作”，Sam Altman 更直言，企业客户现在真正在意的是 AI 支出换回了什么价值；Anthropic 则说，Sonnet 5 能完成的智能体任务，在几个月前还需要更大、更贵的模型。\n当“更便宜”成了行业默认动作，真正的竞争就不再是“降多少价”，而是同样的价格，谁的模型能干更多、更难的任务？\n性价比，开始成为竞争的核心变量。\n1、性价比之争，模型公司重新组合能力、成本与场景\n这种变化首先体现在模型产品本身。模型公司开始把不同能力、不同成本和不同调用方式重新组合起来。\nOpenAI 的 GPT-5.6 最典型。“Sol / Terra / Luna”取代了过去几年“旗舰 + mini/nano”的模型命名体系。这改变了模型分层的逻辑——以前按强弱排序，现在按场景分工。\nSol 承担复杂推理、编程和 Agent 等高难任务，但价格与 GPT-5.5 标准旗舰持平；Terra 的综合表现接近 GPT-5.5，却落在 GPT-5.4 的中端价格区间；Luna 与开源 GLM-5.2 处在同一价位，主打高并发、低延迟的走量调用。\n这套分层的核心，是让能力跟着场景走、成本跟着任务变。复杂任务用旗舰能力，日常任务用主力模型，高频调用优先低延迟和低成本。\nOpenAI 今年 3 月推出Standard / Batch / Flex / Priority 定价机制，进一步把这种思路推进到调用层面。同一个模型，也可以按调用方式定价。能批处理、可等待的请求更便宜；追求低延迟、高确定性的请求更贵。\n这意味着，价格不再只取决于模型能力，也取决于任务对时间和稳定性的要求。过去隐藏在系统调度里的延迟、优先级和确定性，正在被直接写进计费结构。\n6 月底，Anthropic 发布 Claude Sonnet 5 同样指向这一趋势。Sonnet 5 内置了 effort 机制。它让调用方可以根据任务复杂度调节推理强度——中等 effort 用来控制成本，高 effort 才逼近旗舰表现。\n这打破了“选定模型就锁定成本”的旧逻辑。开发者不再只是选择用哪个模型，也可以决定一次调用投入多少算力。性价比因此从静态参数，变成了动态调节。\n7 月 9 日发布的 Grok 4.5，则把性价比前置到了训练阶段：先锁定高频场景，再围绕场景定义模型能力和成本结构。\nGrok 4.5 是 xAI 首个专门针对编程和智能体任务训练的模型，与 Cursor 联合训练，使用了 Cursor 上大量真实交互数据。定价为每百万 token 2 美元输入、6 美元输出，同时提供 MoE 架构、500K 上下文和可配置推理强度。\n编程和 Agent 往往上下文长、调用频繁、链路复杂，一次失败还会触发多轮重试，成本最容易被放大。Grok 4.5 选择先锁定 Cursor 这样的高频入口，再围绕真实调用优化能力和成本。\n这三款模型共同说明，性价比已经不再是一个简单的价格标签。OpenAI 是把不同能力放进不同调用场景；Anthropic 是把旗舰能力压进主力价格区间，并开放推理强度调节；Grok 则是在高频编程场景里重新计算“划算”的标准。\n大模型竞争正在从“能力最大化”转向“有效能力的成本最优化”。\n2、性价比的经济账，从“token 单价”到“单任务成本”\n不同于传统互联网 App，AI 产品每一次调用，都对应一次真实的推理成本。使用越多，价值越大，成本压力也越真实。\n模型竞争进入应用阶段，性价比正在从“价格问题”，延伸为“商业模式问题”。当模型真正进入真实任务场景，决定商业可持续性的，是模型能力能不能在高频调用中，被稳定、低成本地交付出来。\n一个真实任务的成本，通常由一整条任务链路共同决定：输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等，都会被计入最终账本。\n这也带来一个反直觉结论：定价便宜的模型，未必真的便宜。\n如果单次 token 价格低，却需要更多轮对话、更长上下文、更高重试率，那么单位任务成本未必低。反过来，一个看似更贵的模型，如果能用更少轮次完成任务，减少返工、降低失败率，最终反而可能更划算。\n模型性价比的衡量单位正在发生变化——不只看 token 单价，还有完成单个任务所需的成本。\n过去一年，国内模型公司普遍转向 MoE 和稀疏激活，也可以放在这一框架下理解。\nDeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B；Qwen3-235B-A22B 是 235B 总参数、22B 激活；Kimi K2.6 是 1T 总参数、32B 激活。近期发布的腾讯混元 Hy3 正式版，也采用 MoE 架构，295B 总参数、21B 激活参数，并支持 256K 上下文。\n国产大模型集体押注“大参数 + 小激活”，这说明模型能力与调用成本之间的关系，正在被重新设计。\n总参数决定模型的能力池有多大，能覆盖多少知识、推理、代码和 Agent 任务；激活参数决定一次推理真正要支付多少计算成本。MoE 的关键价值正在于此：\n让模型拥有接近超大规模模型的能力边界，同时让每次调用不必承担全量参数的计算开销。\n换句话说，性价比已经前置到模型架构设计阶段，而不再只是模型发布后的定价策略。\n腾讯混元 Hy3 正式版，正是这一趋势的近期样本。它的看点不只是 295B 总参数，更在于用 21B 激活参数承接一个更大的能力池，并将能力重点放在 Agent、办公、知识处理、多文件生成等真实任务上。\n此外，Hy3 正式版智能水平显著强于同尺寸模型，效果可比肩参数规模为其 2—5 倍的旗舰模型。这意味着，Hy3 能用更少的实际激活计算，承接更复杂的任务类型。\n从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，也说明模型经济性开始被真实调用规模检验。\n对国产模型厂商来说，性价比不只体现在开源和 API 价格上，更体现在能否在真实产品和开发者调用中，以更低成本支撑更多任务。\n因此，这一轮性价比竞争，本质上正在变成“单任务经济性”的竞争。\n未来模型公司比拼的，不只是能力池有多大，更是每个任务实际要为这座能力池支付多少成本。谁能用更少计算、更少轮次、更少重试，完成更多真实任务，谁才真正拥有更高的性价比。\n3、“默认调用”之争，大模型迎来“杰文斯时刻”\n当性价比的衡量单位转向“单任务成本”，模型竞争的重心也随之改变。企业和开发者真正关心的，正在从“哪个模型最强”，转向“哪个模型能被长期、稳定、低成本地默认调用”。\n所谓默认调用，指的是模型在办公、知识管理、Agent、客服、代码等高频场景中，系统优先调用的底层能力。它未必总被用户看见，却会持续承接大量真实任务。\n这种变化，已经开始被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router，本质上都在把模型调用从“手动选择”，推进到“统一调度”：系统根据任务复杂度、成本、延迟和性能，将请求路由到更合适的模型。\n开发者生态中的 OpenRouter、LiteLLM、Dify，也在承担类似角色。统一 API、多模型路由、预算控制，以及推理模型等默认能力配置，正在把模型嵌入更上层的应用框架和企业 AI 网关。\n这会重塑模型市场的竞争方式。未来，很多调用未必由终端用户直接决定，而会由云平台、AI 网关、开发框架和企业中台提前分配。谁能进入这些系统的默认配置，谁就能获得更高比例的真实调用。\n默认调用的第一重价值，是规模。一个模型只要能承接企业和开发者每天稳定发生的大量任务，即便单次调用价格不高，也能形成更扎实的商业基本盘。\n规模还会带来反馈。真实任务中的失败率、重试率、用户修正、工具调用路径、上下文组织方式，都会反过来帮助模型和系统优化。模型的进化，离不开静态评测，更离不开真实使用中的暴露、修正与迭代。\n更关键的是，默认调用会带来生态绑定。开发者一旦围绕某个模型调好了提示词、工具调用、RAG 流程、Agent 框架、评测标准和安全策略，这个模型就会从一个可替换的 API，变成应用架构的一部分。\n由此，“性价比”会形成一个新的竞争飞轮：更低单任务成本，带来更多默认调用；更多默认调用，带来更大调用规模和更多真实反馈；真实反馈继续推动模型和系统优化，进一步降低单任务成本。\n腾讯混元 Hy3 与 WorkBuddy 的结合，体现了这一趋势。WorkBuddy 承接企业办公、文件处理、流程编排等高频任务，Hy3 则通过这一入口进入真实工作流。\n公开信息显示，从 preview 到正式版，Hy3 日均 token 消耗增长 20 倍，WorkBuddy 上自主选择 Hy3 preview 的用户数增长 6 倍；正式版在办公场景内部测评中，任务成功率从 72% 提升至 90%，平均耗时缩短约 34%。\n这说明模型开始被真实任务链路反复检验。任务规划、工具调度、多 Agent 协作等能力，只有进入办公场景，才会暴露出失败、重试、耗时和工具调用等具体问题，并反过来推动模型迭代。\n类似的协同优化，已经成为行业共同方向。\nGoogle 将 Gemini 深度嵌入 Gmail、Docs 等工作场景，围绕邮件、文档、会议纪要等高频任务优化；Adobe Firefly 也嵌入 Photoshop、Illustrator、Premiere 等创意工作流，让模型围绕真实编辑、生成和修改链路迭代。\n模型只有进入真实任务，才能获得稳定调用、真实反馈和持续优化空间，最终形成“模型—产品—场景”的协同优化。\n因此，性价比竞争已经超出降价竞赛本身。它真正改变的，是需求边界。\n19 世纪，经济学家杰文斯观察到一个现象：蒸汽机效率越高，煤炭消耗反而越多。效率提升没有抑制使用，反而降低了使用门槛，让煤炭进入更多产业、更多机器和更长的生产链条。\n大模型正在接近自己的“杰文斯时刻”。\n性价比竞争的结果，未必是 AI 总成本下降，而是 AI 使用密度上升。模型调用会从少数高价值任务，扩展到大量日常任务，最终让 AI 变得更实用，也更普惠。\n特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。\nNotice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.163.com/dy/article/L1SMR3L705118O92.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 4675 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4675 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4675,"summary_length":4675,"usable_text_length":4675,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4675,"summary_length":4675}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}