{"id":48881,"topic":"ai","source":"36 Kr","title":"国产大模型，贵到用不起 - 36 Kr","url":"https://www.36kr.com/p/3916524989083271","url_hash":"11499d7394c1390cf3f7e4cb59f73e3abf4ff439","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiUEFVX3lxTE9YVGhlYnFneUgzVGUxVWtaVjdQWl9Lc3NUeTQzRGlNbFotZzJJU0xsMjJQOThoNVRybWxJS3VWVWhVb0x4Q3pYdDhkMS1UQXg2?oc=5\" target=\"_blank\">国产大模型，贵到用不起</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">36 Kr</font>","content":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。\n  一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。\n  尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。\n  根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。\n  但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。\n  即使头部企业，收入仍停留在数亿元量级。\n  相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。\n  这不由得引出了一个尖锐的问题：\n  为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？\n  最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：\n  国产大模型，某种程度上其实非常“贵”。\n  也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。\n  01 “低价”的幻觉\n  提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；\n  如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。\n  但实际上，这种“低价”的印象，是一种圈外人长久的误区。\n  尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。\n  李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。\n  李光晒出的Token账单\n  在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。\n  而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，\n  这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。\n  同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。\n  在这样的套餐兜底下，巨大的Token成本反而被抹平了。\n  对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。\n  小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。\n  但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。\n  小刘的Token账单\n  在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。\n  这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。\n  但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。\n  实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。\n  02 国产定价之痛\n  国产大模型在定价方面的现状，可以用一句话来形容：\n  “你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”\n  举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。\n  以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”\n  在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。\n  “今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。\n  根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。\n  同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。\n  按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”\n  按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。\n  2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。\n  说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。\n  根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。\n  但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。\n  为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。\n  说白了，国产模型的“低价”、“价格战”早已成为了过去式。\n  不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。\n  而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。\n  在高算力的加持下，这套商业模式，本质是用\"固定月费\"换\"长期锁客\"，客户质量高，ARPU 也相对较高，摊得平成本。\n  而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。\n  并且，传统云厂商敢卖\"不限量云服务器\"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。\n  但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。\n  03 模型的“黄金三角”\n  除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。\n  然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。\n  在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。\n  但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。\n  开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。\n  而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。\n  目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。\n  它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。\n  尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。\n  但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。\n  具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。\n  这就引出了当下模型对比中的另一个维度：稳定性。\n  在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——\n  性能—价格—稳定性的“黄金三角”。\n  在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。\n  近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。\n  在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。\n  然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。\n  在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。\n  且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。\n  就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。\n  而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。\n  以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。\n  目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。\n  我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。\n  本文来自微信公众号 “最话FunTalk”（ID：iFuntalker），作者：最话团队，36氪经授权发布。","image_url":"https://img.36krcdn.com/hsossms/20260729/v2_120667fa211f4038918938fc919e3962@5888275@ai_oswg895900oswg1053oswg495_img_png~tplv-1marlgjv7f-ai-v3:600:400:600:400:q70.jpg","lang":"zh","published_at":"2026-07-29T11:45:55+00:00","fetched_at":"2026-07-29T12:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。\n  一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。\n  尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。\n  根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。\n  但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。\n  即使头部企业，收入仍停留在数亿元量级。\n  相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。\n  这不由得引出了一个尖锐的问题：\n  为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？\n  最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：\n  国产大模型，某种程度上其实非常“贵”。\n  也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。\n  01 “低价”的幻觉\n  提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；\n  如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。\n  但实际上，这种“低价”的印象，是一种圈外人长久的误区。\n  尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。\n  李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。\n  李光晒出的Token账单\n  在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。\n  而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，\n  这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。\n  同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。\n  在这样的套餐兜底下，巨大的Token成本反而被抹平了。\n  对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。\n  小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。\n  但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。\n  小刘的Token账单\n  在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。\n  这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。\n  但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。\n  实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。\n  02 国产定价之痛\n  国产大模型在定价方面的现状，可以用一句话来形容：\n  “你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”\n  举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。\n  以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”\n  在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。\n  “今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。\n  根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。\n  同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。\n  按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”\n  按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。\n  2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。\n  说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。\n  根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。\n  但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。\n  为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。\n  说白了，国产模型的“低价”、“价格战”早已成为了过去式。\n  不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。\n  而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。\n  在高算力的加持下，这套商业模式，本质是用\"固定月费\"换\"长期锁客\"，客户质量高，ARPU 也相对较高，摊得平成本。\n  而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。\n  并且，传统云厂商敢卖\"不限量云服务器\"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。\n  但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。\n  03 模型的“黄金三角”\n  除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。\n  然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。\n  在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。\n  但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。\n  开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。\n  而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。\n  目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。\n  它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。\n  尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。\n  但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。\n  具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。\n  这就引出了当下模型对比中的另一个维度：稳定性。\n  在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——\n  性能—价格—稳定性的“黄金三角”。\n  在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。\n  近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。\n  在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。\n  然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。\n  在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。\n  且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。\n  就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。\n  而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。\n  以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。\n  目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。\n  我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。\n  本文来自微信公众号 “最话FunTalk”（ID：iFuntalker），作者：最话团队，36氪经授权发布。","cluster_id":1677344,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.36kr.com/p/3916524989083271","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5295 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5295,"summary_length":5295,"usable_text_length":5295,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5295,"summary_length":5295}},"news_item":{"id":48881,"canonical_url":"https://www.36kr.com/p/3916524989083271","source_url":"https://www.36kr.com/p/3916524989083271","title":"国产大模型，贵到用不起 - 36 Kr","source_name":"36 Kr","author":null,"published_at":"2026-07-29T11:45:55+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiUEFVX3lxTE9YVGhlYnFneUgzVGUxVWtaVjdQWl9Lc3NUeTQzRGlNbFotZzJJU0xsMjJQOThoNVRybWxJS3VWVWhVb0x4Q3pYdDhkMS1UQXg2?oc=5\" target=\"_blank\">国产大模型，贵到用不起</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">36 Kr</font>","full_text":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。\n  一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。\n  尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。\n  根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。\n  但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。\n  即使头部企业，收入仍停留在数亿元量级。\n  相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。\n  这不由得引出了一个尖锐的问题：\n  为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？\n  最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：\n  国产大模型，某种程度上其实非常“贵”。\n  也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。\n  01 “低价”的幻觉\n  提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；\n  如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。\n  但实际上，这种“低价”的印象，是一种圈外人长久的误区。\n  尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。\n  李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。\n  李光晒出的Token账单\n  在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。\n  而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，\n  这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。\n  同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。\n  在这样的套餐兜底下，巨大的Token成本反而被抹平了。\n  对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。\n  小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。\n  但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。\n  小刘的Token账单\n  在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。\n  这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。\n  但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。\n  实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。\n  02 国产定价之痛\n  国产大模型在定价方面的现状，可以用一句话来形容：\n  “你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”\n  举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。\n  以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”\n  在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。\n  “今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。\n  根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。\n  同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。\n  按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”\n  按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。\n  2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。\n  说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。\n  根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。\n  但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。\n  为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。\n  说白了，国产模型的“低价”、“价格战”早已成为了过去式。\n  不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。\n  而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。\n  在高算力的加持下，这套商业模式，本质是用\"固定月费\"换\"长期锁客\"，客户质量高，ARPU 也相对较高，摊得平成本。\n  而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。\n  并且，传统云厂商敢卖\"不限量云服务器\"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。\n  但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。\n  03 模型的“黄金三角”\n  除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。\n  然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。\n  在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。\n  但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。\n  开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。\n  而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。\n  目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。\n  它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。\n  尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。\n  但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。\n  具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。\n  这就引出了当下模型对比中的另一个维度：稳定性。\n  在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——\n  性能—价格—稳定性的“黄金三角”。\n  在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。\n  近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。\n  在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。\n  然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。\n  在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。\n  且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。\n  就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。\n  而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。\n  以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。\n  目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。\n  我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。\n  本文来自微信公众号 “最话FunTalk”（ID：iFuntalker），作者：最话团队，36氪经授权发布。","excerpt":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。\n  一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。\n  尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。\n  根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。\n  但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。\n  即使头部企业，收入仍停留在数亿元量级。\n  相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。\n  这不由得引出了一个尖锐的问题：\n  为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？\n  最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：\n  国产大模型，某种程度上其实非常“贵”。\n  也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。\n  01 “低价”的幻觉\n  提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；\n  如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。\n  但实际上，这种“低价”的印象，是一种圈外人长久的误区。\n  尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。\n  李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。\n  李光晒出的Token账单\n  在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。\n  而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，\n  这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。\n  同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。\n  在这样的套餐兜底下，巨大的Token成本反而被抹平了。\n  对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。\n  小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。\n  但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。\n  小刘的Token账单\n  在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。\n  这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。\n  但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。\n  实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。\n  02 国产定价之痛\n  国产大模型在定价方面的现状，可以用一句话来形容：\n  “你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”\n  举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。\n  以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”\n  在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。\n  “今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。\n  根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。\n  同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。\n  按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”\n  按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。\n  2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。\n  说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。\n  根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。\n  但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。\n  为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。\n  说白了，国产模型的“低价”、“价格战”早已成为了过去式。\n  不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。\n  而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。\n  在高算力的加持下，这套商业模式，本质是用\"固定月费\"换\"长期锁客\"，客户质量高，ARPU 也相对较高，摊得平成本。\n  而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。\n  并且，传统云厂商敢卖\"不限量云服务器\"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。\n  但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。\n  03 模型的“黄金三角”\n  除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。\n  然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。\n  在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。\n  但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。\n  开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。\n  而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。\n  目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。\n  它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。\n  尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。\n  但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。\n  具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。\n  这就引出了当下模型对比中的另一个维度：稳定性。\n  在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——\n  性能—价格—稳定性的“黄金三角”。\n  在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。\n  近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。\n  在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。\n  然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。\n  在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。\n  且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。\n  就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。\n  而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。\n  以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。\n  目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。\n  我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。\n  本文来自微信公众号 “最话FunTalk”（ID：iFuntalker），作者：最话团队，36氪经授权发布。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 5295 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.36kr.com/p/3916524989083271","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5295 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5295,"summary_length":5295,"usable_text_length":5295,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5295,"summary_length":5295}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"国产大模型，贵到用不起 - 36 Kr","url":"https://www.36kr.com/p/3916524989083271","summary":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。\n  一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。\n  尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。\n  根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。\n  但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。\n  即使头部企业，收入仍停留在数亿元量级。\n  相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。\n  这不由得引出了一个尖锐的问题：\n  为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？\n  最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：\n  国产大模型，某种程度上其实非常“贵”。\n  也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。\n  01 “低价”的幻觉\n  提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；\n  如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。\n  但实际上，这种“低价”的印象，是一种圈外人长久的误区。\n  尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。\n  李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。\n  李光晒出的Token账单\n  在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。\n  而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，\n  这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。\n  同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。\n  在这样的套餐兜底下，巨大的Token成本反而被抹平了。\n  对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。\n  小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。\n  但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。\n  小刘的Token账单\n  在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。\n  这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。\n  但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。\n  实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。\n  02 国产定价之痛\n  国产大模型在定价方面的现状，可以用一句话来形容：\n  “你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”\n  举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。\n  以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”\n  在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。\n  “今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。\n  根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。\n  同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。\n  按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”\n  按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。\n  2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。\n  说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。\n  根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。\n  但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。\n  为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。\n  说白了，国产模型的“低价”、“价格战”早已成为了过去式。\n  不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。\n  而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。\n  在高算力的加持下，这套商业模式，本质是用\"固定月费\"换\"长期锁客\"，客户质量高，ARPU 也相对较高，摊得平成本。\n  而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。\n  并且，传统云厂商敢卖\"不限量云服务器\"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。\n  但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。\n  03 模型的“黄金三角”\n  除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。\n  然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。\n  在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。\n  但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。\n  开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。\n  而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。\n  目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。\n  它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。\n  尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。\n  但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。\n  具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。\n  这就引出了当下模型对比中的另一个维度：稳定性。\n  在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——\n  性能—价格—稳定性的“黄金三角”。\n  在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。\n  近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。\n  在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。\n  然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。\n  在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。\n  且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。\n  就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。\n  而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。\n  以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。\n  目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。\n  我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。\n  本文来自微信公众号 “最话FunTalk”（ID：iFuntalker），作者：最话团队，36氪经授权发布。","source":"36 Kr","date":"2026-07-29T11:45:55+00:00","content":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。\n  一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。\n  尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。\n  根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。\n  但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。\n  即使头部企业，收入仍停留在数亿元量级。\n  相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。\n  这不由得引出了一个尖锐的问题：\n  为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？\n  最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：\n  国产大模型，某种程度上其实非常“贵”。\n  也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。\n  01 “低价”的幻觉\n  提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；\n  如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。\n  但实际上，这种“低价”的印象，是一种圈外人长久的误区。\n  尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。\n  李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。\n  李光晒出的Token账单\n  在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。\n  而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，\n  这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。\n  同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。\n  在这样的套餐兜底下，巨大的Token成本反而被抹平了。\n  对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。\n  小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。\n  但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。\n  小刘的Token账单\n  在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。\n  这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。\n  但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。\n  实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。\n  02 国产定价之痛\n  国产大模型在定价方面的现状，可以用一句话来形容：\n  “你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”\n  举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。\n  以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”\n  在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。\n  “今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。\n  根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。\n  同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。\n  按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”\n  按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。\n  2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。\n  说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。\n  根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。\n  但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。\n  为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。\n  说白了，国产模型的“低价”、“价格战”早已成为了过去式。\n  不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。\n  而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。\n  在高算力的加持下，这套商业模式，本质是用\"固定月费\"换\"长期锁客\"，客户质量高，ARPU 也相对较高，摊得平成本。\n  而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。\n  并且，传统云厂商敢卖\"不限量云服务器\"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。\n  但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。\n  03 模型的“黄金三角”\n  除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。\n  然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。\n  在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。\n  但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。\n  开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。\n  而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。\n  目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。\n  它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。\n  尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。\n  但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。\n  具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。\n  这就引出了当下模型对比中的另一个维度：稳定性。\n  在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——\n  性能—价格—稳定性的“黄金三角”。\n  在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。\n  近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。\n  在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。\n  然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。\n  在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。\n  且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。\n  就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。\n  而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。\n  以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。\n  目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。\n  我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。\n  本文来自微信公众号 “最话FunTalk”（ID：iFuntalker），作者：最话团队，36氪经授权发布。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.36kr.com/p/3916524989083271","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 5295 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5295 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5295,"summary_length":5295,"usable_text_length":5295,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5295,"summary_length":5295}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/48881","export_markdown":"/api/items/48881/export?format=markdown","export_json":"/api/items/48881/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.36kr.com/p/3916524989083271"},"formats":{"full":{"id":48881,"title":"国产大模型，贵到用不起 - 36 Kr","url":"https://www.36kr.com/p/3916524989083271","source":"36 Kr","author":null,"published_at":"2026-07-29T11:45:55+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。\n  一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。\n  尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。\n  根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。\n  但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。\n  即使头部企业，收入仍停留在数亿元量级。\n  相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。\n  这不由得引出了一个尖锐的问题：\n  为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？\n  最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：\n  国产大模型，某种程度上其实非常“贵”。\n  也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。\n  01 “低价”的幻觉\n  提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；\n  如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。\n  但实际上，这种“低价”的印象，是一种圈外人长久的误区。\n  尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。\n  李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。\n  李光晒出的Token账单\n  在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。\n  而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，\n  这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。\n  同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。\n  在这样的套餐兜底下，巨大的Token成本反而被抹平了。\n  对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。\n  小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。\n  但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。\n  小刘的Token账单\n  在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。\n  这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。\n  但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。\n  实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。\n  02 国产定价之痛\n  国产大模型在定价方面的现状，可以用一句话来形容：\n  “你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”\n  举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。\n  以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”\n  在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。\n  “今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。\n  根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。\n  同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。\n  按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”\n  按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。\n  2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。\n  说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。\n  根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。\n  但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。\n  为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。\n  说白了，国产模型的“低价”、“价格战”早已成为了过去式。\n  不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。\n  而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。\n  在高算力的加持下，这套商业模式，本质是用\"固定月费\"换\"长期锁客\"，客户质量高，ARPU 也相对较高，摊得平成本。\n  而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。\n  并且，传统云厂商敢卖\"不限量云服务器\"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。\n  但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。\n  03 模型的“黄金三角”\n  除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。\n  然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。\n  在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。\n  但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。\n  开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。\n  而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。\n  目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。\n  它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。\n  尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。\n  但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。\n  具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。\n  这就引出了当下模型对比中的另一个维度：稳定性。\n  在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——\n  性能—价格—稳定性的“黄金三角”。\n  在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。\n  近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。\n  在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。\n  然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。\n  在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。\n  且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。\n  就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。\n  而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。\n  以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。\n  目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。\n  我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。\n  本文来自微信公众号 “最话FunTalk”（ID：iFuntalker），作者：最话团队，36氪经授权发布。","full_text":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。\n  一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。\n  尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。\n  根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。\n  但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。\n  即使头部企业，收入仍停留在数亿元量级。\n  相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。\n  这不由得引出了一个尖锐的问题：\n  为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？\n  最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：\n  国产大模型，某种程度上其实非常“贵”。\n  也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。\n  01 “低价”的幻觉\n  提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；\n  如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。\n  但实际上，这种“低价”的印象，是一种圈外人长久的误区。\n  尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。\n  李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。\n  李光晒出的Token账单\n  在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。\n  而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，\n  这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。\n  同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。\n  在这样的套餐兜底下，巨大的Token成本反而被抹平了。\n  对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。\n  小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。\n  但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。\n  小刘的Token账单\n  在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。\n  这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。\n  但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。\n  实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。\n  02 国产定价之痛\n  国产大模型在定价方面的现状，可以用一句话来形容：\n  “你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”\n  举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。\n  以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”\n  在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。\n  “今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。\n  根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。\n  同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。\n  按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”\n  按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。\n  2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。\n  说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。\n  根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。\n  但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。\n  为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。\n  说白了，国产模型的“低价”、“价格战”早已成为了过去式。\n  不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。\n  而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。\n  在高算力的加持下，这套商业模式，本质是用\"固定月费\"换\"长期锁客\"，客户质量高，ARPU 也相对较高，摊得平成本。\n  而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。\n  并且，传统云厂商敢卖\"不限量云服务器\"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。\n  但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。\n  03 模型的“黄金三角”\n  除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。\n  然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。\n  在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。\n  但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。\n  开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。\n  而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。\n  目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。\n  它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。\n  尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。\n  但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。\n  具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。\n  这就引出了当下模型对比中的另一个维度：稳定性。\n  在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——\n  性能—价格—稳定性的“黄金三角”。\n  在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。\n  近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。\n  在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。\n  然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。\n  在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。\n  且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。\n  就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。\n  而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。\n  以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。\n  目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。\n  我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。\n  本文来自微信公众号 “最话FunTalk”（ID：iFuntalker），作者：最话团队，36氪经授权发布。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 5295 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.36kr.com/p/3916524989083271","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5295 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5295,"summary_length":5295,"usable_text_length":5295,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5295,"summary_length":5295}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5295 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5295,"summary_length":5295,"usable_text_length":5295,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5295,"summary_length":5295}},"actions":{"read":"/item/48881","export_markdown":"/api/items/48881/export?format=markdown","export_json":"/api/items/48881/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.36kr.com/p/3916524989083271"}},"digest":{"id":48881,"title":"国产大模型，贵到用不起 - 36 Kr","url":"https://www.36kr.com/p/3916524989083271","source":"36 Kr","topic":"ai","published_at":"2026-07-29T11:45:55+00:00","excerpt":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。 一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。 尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。 根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 5295 characters.","reading_time_min":1,"cluster_id":1677344},"card":{"display_title":"国产大模型，贵到用不起 - 36 Kr","subtitle":"36 Kr · 2026-07-29","summary":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。 一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。 尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。 根据最新数据，在使用量方面：OpenRouter…","badges":["quality:high"],"links":{"read":"/item/48881","original":"https://www.36kr.com/p/3916524989083271","diagnose":"/api/diagnose?url=https%3A//www.36kr.com/p/3916524989083271"},"quality_warning":null},"export":{"title":"国产大模型，贵到用不起 - 36 Kr","url":"https://www.36kr.com/p/3916524989083271","summary":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。\n  一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。\n  尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。\n  根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。\n  但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。\n  即使头部企业，收入仍停留在数亿元量级。\n  相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。\n  这不由得引出了一个尖锐的问题：\n  为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？\n  最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：\n  国产大模型，某种程度上其实非常“贵”。\n  也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。\n  01 “低价”的幻觉\n  提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；\n  如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。\n  但实际上，这种“低价”的印象，是一种圈外人长久的误区。\n  尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。\n  李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。\n  李光晒出的Token账单\n  在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。\n  而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，\n  这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。\n  同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。\n  在这样的套餐兜底下，巨大的Token成本反而被抹平了。\n  对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。\n  小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。\n  但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。\n  小刘的Token账单\n  在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。\n  这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。\n  但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。\n  实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。\n  02 国产定价之痛\n  国产大模型在定价方面的现状，可以用一句话来形容：\n  “你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”\n  举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。\n  以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”\n  在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。\n  “今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。\n  根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。\n  同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。\n  按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”\n  按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。\n  2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。\n  说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。\n  根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。\n  但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。\n  为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。\n  说白了，国产模型的“低价”、“价格战”早已成为了过去式。\n  不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。\n  而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。\n  在高算力的加持下，这套商业模式，本质是用\"固定月费\"换\"长期锁客\"，客户质量高，ARPU 也相对较高，摊得平成本。\n  而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。\n  并且，传统云厂商敢卖\"不限量云服务器\"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。\n  但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。\n  03 模型的“黄金三角”\n  除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。\n  然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。\n  在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。\n  但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。\n  开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。\n  而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。\n  目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。\n  它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。\n  尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。\n  但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。\n  具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。\n  这就引出了当下模型对比中的另一个维度：稳定性。\n  在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——\n  性能—价格—稳定性的“黄金三角”。\n  在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。\n  近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。\n  在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。\n  然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。\n  在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。\n  且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。\n  就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。\n  而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。\n  以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。\n  目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。\n  我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。\n  本文来自微信公众号 “最话FunTalk”（ID：iFuntalker），作者：最话团队，36氪经授权发布。","source":"36 Kr","date":"2026-07-29T11:45:55+00:00","content":"最近这一个月，硅谷AI界可谓大招频出，GPT-5.6、fable5、Grok-4.5接连问世。\n  一时间，国内开发者、程序员群体纷纷沸腾，各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。\n  尽管这个月也有Kimi-K3这样的新锐国产模型问世，但总的来看，国产大模型当前在一线开发者群体中，始终处于一种“叫好不叫座”的状态。\n  根据最新数据，在使用量方面：OpenRouter 6月22日至28日数据显示，中国模型周调用量达20.39万亿Token，美国模型为4.25万亿，前者已连续九周领先。\n  但与之形成反差的是，国内AI六小龙在营收方面的表现，却不怎么尽如人意：公开财报显示，智谱2025年营收7.24亿元，亏损却达到了30亿元以上，MiniMax为7900万美元（约5.7亿元）；月之暗面等其余四家尚未披露完整年营收。\n  即使头部企业，收入仍停留在数亿元量级。\n  相较之下，作为AI头部企业的Anthropic，其ARR已经达到了约 600 亿—700 亿美元，主要驱动力为 B2B API 及 AI Coding 场景 。\n  这不由得引出了一个尖锐的问题：\n  为何号称“便宜”、“调用量大”的国产模型，至今仍然叫好不叫座，在AI Coding等高价值的场景上，至今仍难以与国外顶尖模型正面抗衡？\n  最近，笔者在与多个一线开发者深入探讨此问题后，发现了一个很反直觉的事实：\n  国产大模型，某种程度上其实非常“贵”。\n  也正是这样的“贵”，让某些性能上有所突破的国产模型，难以真正展现自己的闪光之处。\n  01 “低价”的幻觉\n  提起国产大模型，很多人想到的都是DeepSeek、Kimi、智谱这样的代表，而与之关联最紧密的标签之一，就是低价、便宜；\n  如果仅从Token单价上来看，国产模型与GPT-5.6、fable5等顶尖模型相比，确实有着不小的优势，拿GLM-5.2与DeepSeek V4举例：GLM-5.2每百万Token输入/输出为1.4/4.4美元，DeepSeek-V4-Pro为0.435/0.87美元；GPT-5.6 Sol为5/30美元，Claude Fable 5则为10/50美元。\n  但实际上，这种“低价”的印象，是一种圈外人长久的误区。\n  尤其在高强度的编程场景下，国产大模型的单价不但没有优势，甚至反而还比有套餐的GPT、Claude贵出好几倍。\n  李光（化名）是AI领域的一位科研工作者，由于工作需要，每天都要在AI Coding的场景下消耗几十亿Token，在这样的消耗量下，如果用国产大模型，例如GLM-5.2，整体的成本就会变得非常恐怖。\n  李光晒出的Token账单\n  在交谈当天，李光消耗的Token已经接近40亿，这里可以稍微换算一下，倘若他用的是GLM-5.2，成本大致是：（8639万普通输入×1.4美元＋33.80亿缓存输入×0.26美元＋1906万输出及推理×4.4美元）约为1084美元，按1美元兑7.2元估算，约合人民币7800元。\n  而让李光如此放开手脚烧Token的原因，就是因为他开了GPT的CodeX套餐，\n  这里简单解释一下CodeX套餐的具体形式，简单来说，它是针对编程场景推出的一款套餐：严格说来，它并非真正不限量，而是把Codex纳入ChatGPT订阅：Plus为20美元/月，Pro从100美元/月起，额度约为Plus的5倍或20倍；触顶后可购买Credits继续使用。\n  同样地，Anthropic的Claude Code也有一套类似的套餐，具体形式是：Claude Pro为20美元/月，Max 5x和Max 20x分别为100、200美元/月；Claude网页端与Claude Code共享每5小时及每周额度，触顶后可按API价格续用。\n  在这样的套餐兜底下，巨大的Token成本反而被抹平了。\n  对于国内的开发者来说，在高强度AI Coding场景下，每天消耗几十亿、上百亿Token，是一个很普遍的常态。\n  小刘也是一个AI Coding的重度开发者，他在Codex上实际一周的花费是 300元人民币，而这还是在没有公司报销的情况下。\n  但即使是这样的成本，对比国产模型，依然显得“便宜”了很多，因为同样300元，根本买不来GLM 5.2 同等数量的token。\n  小刘的Token账单\n  在国内开发者看来，GPT的 codex 套餐，是目前能买到的最便宜的 token，比智谱、kimi 便宜好几倍，这可能反直觉，但是事实就是国产模型在高强度的Coding场景下，性价比完全无法与之对比。\n  这里需要说明的是：codex并非真正意义的不限量套餐，如果按最高档200美元算，一周大概有20亿额度。\n  但是，由于部分开发者会通过“中转站”等手段使用模型，某些模型的实际成本，会比官方渠道低很多，这就导致有时能以更低的价格，买到更多Token，于是才有了300块能买120亿Token的现象。\n  实际上，国产模型在定价方面，不是没有推出过类似的套餐，但如果细究起来，这样的套餐，在限额方面，比起codex而言，存在着很大的限制。\n  02 国产定价之痛\n  国产大模型在定价方面的现状，可以用一句话来形容：\n  “你以为你进的是自助餐的场子，但最后发现，商家还是按斤计费。”\n  举例来说，在套餐方面，国内的Kimi、GLM-5.2：Kimi Code分为49、99、199、699元四档，额度按周刷新；GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt，每周约400、2000、8000次，且GLM-5.2高峰期按3倍扣额。\n  以阿里的qoder为例，根据笔者一位从事B端客户运维的朋友阿迷（化名）介绍：“qoder曾经是国内最好用的AI IDE，可惜它自己的新定价，把优势搞没了。”\n  在套餐方面：Qoder CN个人Pro、Pro+分别为59、169元/月，含2000、6000 Credits；Teams与VPC版分别为99、199元/席位·月，均含3000 Credits，后者50席起售。\n  “今年他们合并灵码调了定价后，就我知道的，至少都有二三十家放弃续费了。”阿迷后来介绍道。\n  根据阿迷的测试，qoder企业版199的套餐，按他的用法，3天就没了，如果按重度开发者的用法，估计一天就没了。\n  同样地，在套餐方面，令国内用户感到五味陈杂的，还有GLM-5.2。\n  按照开发者小薇的说法：“GLM-5.2的套餐约等于没有，就算有套餐高峰期仍然限流，并且还存在‘背刺’用户的现象。”\n  按照36氪的报道：GLM-5.2的套餐，之前比演唱会门票还难抢，每天早上十点钟准时刷新，能不能买到全凭手速。\n  2026 年 1 月，智谱发公告说因为算力紧张，把每日可销售量直接砍到原来的 20%，每天早上 10 点放一点额度，几分钟就售罄。\n  说到底，国产模型在套餐、价格上的“吝啬”，本质上是算力不足造成的窘迫。\n  根据2025年中国信通院、工信部的数据，中国现存的数据中心是449 个，而美国则是5427 个，在总算力方面，中国为1053 EFLOPS，而美国则是2400。\n  但这里的关键在于：美国那2,400 EFLOPS 里，高端 GPU 占比极高；中国的算力里，大量是华为昇腾、寒武纪等国产芯片，单卡性能与 H100 仍有代差。\n  为应对愈发高涨的算力需求，2026 年 3 月开始，智谱、阿里云、腾讯云、百度在Token价格上集体涨价，涨幅从 5% 到 460% 不等。\n  说白了，国产模型的“低价”、“价格战”早已成为了过去式。\n  不是国产模型不想搞buffet，是因为算过账：以现在的算力成本和亏损状态，搞包月等于拿固定月费去赌用户不会刷爆，而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法，这样的商业模式，很快会被击穿成本线。\n  而OpenAI 和 Anthropic 的编程套餐，卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。\n  在高算力的加持下，这套商业模式，本质是用\"固定月费\"换\"长期锁客\"，客户质量高，ARPU 也相对较高，摊得平成本。\n  而相较之下，国内虽然有阿里这样的云巨头，但问题是：阿里云FY2026 调整后 EBITA Margin 只有 7.5%，云智能集团虽然收入增长快，但利润并不丰厚。\n  并且，传统云厂商敢卖\"不限量云服务器\"，是因为用户不是 24 小时满负载。一台 ECS，实际 CPU 利用率可能只有 10%，云厂商可以把一台物理机超卖给十个人。\n  但大模型推理不一样：来一个token，就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷，云厂商的 HBM 显存、GPU 核心、电费全是刚性支出，没有任何超卖空间。\n  03 模型的“黄金三角”\n  除了价格方面的因素外，对国内开发者来说，选择Codex、Calude Code的原因，无疑是其强大的编程性能。\n  然而，在性能方面，国产模型也并非像某些刻板印象中想的那样。\n  在与多个开发者交谈后，笔者发现一个较为普遍的观点是：国产大模型，尤其是GLM-5.2等最新的模型，已经可以承接一些辅助性的、次要的任务，例如做测试和修改bug。\n  但在较为复杂的、长时间的异步任务上，国产模型目前与GPT、Calude等顶尖模型，仍有较大差距。\n  开发者小张，今年3月份用过一次国产模型编程，用GLM、qwen和GPT对比同样的任务，只有gpt跑完了，且符合页面要求，那是一个多级、多列内容比对和结果生成的项目。\n  而另一个开发者小薇则表示，根据她的体验，Kimi 2.7 和 豆包 2.1 Pro 性能也尚可，但是它总的来说还是要弱一档（属于第二梯队），但总体而言也超过 Claude Sonnet 4.6 了。\n  目前，开发者群体中的普遍共识是：GLM-5.2是第一个达到了 Opus 级别的国产模型。\n  它在执行真实的、复杂的、长时间的异步任务中，它是可用的、占据了一席之地的。\n  尽管在很多维度，例如世界知识上，其与真正的Opus模型仍有较大差距，但这不妨碍其成为国产模型的新高度。\n  但现实是：这刚刚崭露头角少数“尖子生”，却被与性能无关的其他因素拖累了。\n  具体来说，这样的因素包括了缓存效率不高、高峰期仍然会限流等等，让开发者的实际体验很糟糕。\n  这就引出了当下模型对比中的另一个维度：稳定性。\n  在一线开发者、程序员的体验中，模型的选择，早已不是简单的性能对比，而是——\n  性能—价格—稳定性的“黄金三角”。\n  在这三个维度中，国产模型只勉强拿下了第一维度的部分指标。\n  近期，国内的Kimi发布了其最新的旗舰模型K3：这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型，主攻长程编程、知识工作与深度推理。\n  在众多测评中，其在Artificial Analysis上的智力指数是57分、位列全球第三；Arena前端编程榜以1679分登顶，甚至有传言称，其性能已经能比肩Claude Fable 5。\n  然而，在耀眼的分数与排名背后，开发者关切最多的，仍然是一个词：性价比。\n  在K3发布后，很多开发者表示，现在Kimi仍然很贵，与Codex相比没有性价比，且额度不够用，单看API价格，K3也谈不上“白菜价”：每百万Token缓存/输入/输出分别为2/20/100元；GPT-5.6 Sol为0.5/5/30美元，K3虽低于Sol，却明显高于GPT-5.6 Luna的0.1/1/6美元。\n  且在使用K3的过程中，开发者表示还出现了API断连，甚至断了一上午的情况。\n  就目前的情况来看，国内开发者不是不愿意为国产模型付费，而是国产模型目前因算力紧、成本高，目前开不起Codex这样具有性价比的套餐，只能开看似自助餐，实则限量的“大众点评套餐”（类似智谱 的Coding Plan）。\n  而套餐的体验不稳定、性价比模糊，导致用户使用过难以留存。这本质上，是在目前算力底座成本高的情况下，用户的理性选择。\n  以上这些，并非我们要长他人志气，灭自己威风，只是想提示一种风险。\n  目前，国产模型在追赶GPT、Claude的路途中，非常喜欢强调性能，但国产大模型从研发到应用，需要攀登的，远不止性能这一座高山。\n  我们需要的是等待，等到国产算力基座大规模量产了，在技术、价格、稳定性方面，形成合力了，我们的产品就能撑起用户的期待。\n  本文来自微信公众号 “最话FunTalk”（ID：iFuntalker），作者：最话团队，36氪经授权发布。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.36kr.com/p/3916524989083271","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 5295 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5295 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5295,"summary_length":5295,"usable_text_length":5295,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5295,"summary_length":5295}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}