# 国产大模型，贵到用不起？ - 钛媒体

*Источник: 钛媒体*
*Дата: 2026-07-30*
*Язык: zh*

**Кратко:** 文 | 最话FunTalk，作者 | 林书
最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。
一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。
尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。
根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。
但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。
即使头部企业，收入仍停留在数亿元量级。
相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。
这不由得引出了一个尖锐的问题：
为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？
最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：
国产大模型，某种程度上其实非常“贵”。
也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。
01“低价”的幻觉
提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；
如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。
但实际上，这种“低价”的印象，是一种圈外人长久的误区。
尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。
李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。
在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。
而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，
这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。
同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。
在这样的套餐兜底下，巨大的Token成本反而被抹平了。
对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。
小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。
但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。
在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。
这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。
但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。
实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。
02 国产定价之痛
国产大模型在定价方面的现状，可以用一句话来形容：
“你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”
举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。
以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”
在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。
“今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。
根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。
同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。
按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”
按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。
2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。
说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。
根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。
但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。
为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。
说白了，国产模型的“低价”、“价格战”早已成为了过去式。
不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。
而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。
在高算力的加持下，这套商业模式，本质是用"固定月费"换"长期锁客"，客户质量高，ARPU 也相对较高，摊得平成本。
而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。
并且，传统云厂商敢卖"不限量云服务器"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。
但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。
03 模型的“黄金三角”
除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。
然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。
在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。
但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。
开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。
而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。
目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。
它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。
尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。
但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。
具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。
这就引出了当下模型对比中的另一个维度：稳定性。
在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——
性能—价格—稳定性的“黄金三角”。
在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。
近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。
在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。
然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。
在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。
且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。
就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。
而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。
以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。
目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。
我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。

文 | 最话FunTalk，作者 | 林书
最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。
一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。
尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。
根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。
但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。
即使头部企业，收入仍停留在数亿元量级。
相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。
这不由得引出了一个尖锐的问题：
为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？
最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：
国产大模型，某种程度上其实非常“贵”。
也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。
01“低价”的幻觉
提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；
如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。
但实际上，这种“低价”的印象，是一种圈外人长久的误区。
尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。
李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。
在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。
而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，
这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。
同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。
在这样的套餐兜底下，巨大的Token成本反而被抹平了。
对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。
小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。
但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。
在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。
这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。
但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。
实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。
02 国产定价之痛
国产大模型在定价方面的现状，可以用一句话来形容：
“你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”
举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。
以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”
在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。
“今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。
根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。
同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。
按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”
按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。
2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。
说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。
根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。
但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。
为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。
说白了，国产模型的“低价”、“价格战”早已成为了过去式。
不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。
而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。
在高算力的加持下，这套商业模式，本质是用"固定月费"换"长期锁客"，客户质量高，ARPU 也相对较高，摊得平成本。
而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。
并且，传统云厂商敢卖"不限量云服务器"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。
但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。
03 模型的“黄金三角”
除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。
然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。
在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。
但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。
开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。
而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。
目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。
它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。
尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。
但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。
具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。
这就引出了当下模型对比中的另一个维度：稳定性。
在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——
性能—价格—稳定性的“黄金三角”。
在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。
近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。
在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。
然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。
在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。
且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。
就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。
而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。
以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。
目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。
我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。

[Оригинал](https://www.tmtpost.com/8084364.html)