# 2025大模型轻量化趋势解析 头部AI厂商集体布局小模型技术 - 36Kr

*Источник: 36Kr*
*Дата: 2026-09-19*
*Язык: zh*

**Кратко:** 文 | 李炤锋 王欣逸
  编辑 | 张雨忻
   
  在深圳，林舟所在的AI创业公司只有十个人，大部分工作都靠 AI 来完成——每天数百个Agent（智能体）同时运行，它们分头写代码、做研究。
  而驱动这些Agent的，一直都是OpenAI的GPT系列模型。
  但随着团队交给Agent的任务越来越多，林舟发现GPT跟不上了——他们当时使用的GPT5.6，一次只能同时处理两三个任务。“GPT能处理的并发任务有限，会耽误我们的工作进度。”林舟说，团队开始寻找能让更多任务同时运行、调用价格也更低的模型。
  DeepSeek V4.1 Flash成了新选择。9月以来，团队试用了Claude和几款国产模型，最后选中V4.1 Flash：它能完成手头的开发任务，反馈更快，调用费用也更低。林舟说，这是他们眼下“性价比最高”的选择。
  今年更早的时候，Google CEO Sundar Pichai在 Google I/O大会上说，据他了解，有些公司到了5月，全年Token预算就已经快用完了。就以Google自己为例，其内部AI编程工具每天消耗的Token也从3月的5000亿涨到5 月的超过3万亿。
  而就是在这次大会上，Google推出了速度更快、成本也更低的Gemini 3.5 Flash，瞄准更日常的开发和工作场景——今年以来，OpenClaw掀起的“龙虾”热潮，让普通用户也开始用Agent处理各种工作事务，这是比编程更日常、更低门槛、更高频的需求。
  与此同时，越来越多的小参数模型开始出现。因为任务越来越多，模型的调用也会更频繁，若使用几千亿甚至两三万亿参数的旗舰模型，用户要承担的费用会非常高；并且大参数模型的速度也快不起来，会大大增加用户的等待时间。
  模型厂商，尤其是中国模型厂商，接连推出Flash版本的小参数模型，争的正是这批过去也在由旗舰模型完成日常需求。Flash，意为“闪电”。模型厂商通常用这样的命名来表示更快、价格更低的模型版本：它每次运行调用的参数较少，适合用来反复处理日常任务；而复杂问题仍可交给Pro等旗舰模型。
  7月31日，DeepSeek发布V4 Flash正式版；8月26日，阿里Qwen团队的Qwen3.8-Flash-Next与智谱的GLM-5.3-Flash同日亮相；9月，DeepSeek又推出V4.1 Flash。这几款模型参数大小不一，均在千亿级别（从100B-500B的参数区间），远小于当前的旗舰模型万亿级别的参数。
  两个月前，当DeepSeek V4 Flash正式发布后，有开发者把它的评测成绩和完成任务的成本画在一张图上，提出所谓“斩杀线”：那些性能不如V4 Flash，做同样的任务却更贵的模型，就这样被“斩杀”。
  灰色区域内的模型被 DeepSeek V4 Flash “斩杀”，来源：Artificial Analysis
  8月下旬，美国编程Agent平台Cline开始免费提供一款未公布身份的模型。Cline称，不到一周，这款模型承担了平台超过11%的推理量。随后，智谱认领了这款模型，正是后来推出的 GLM-5.3-Flash。此前，智谱创始人唐杰在业绩会上谈到下一代模型，他说，公司“不会做一个大而无用的模型”。
  事实上，“小模型”阵营还在不断扩大。智能涌现了解到，月之暗面和腾讯混元，都在推动Flash模型版本的开发。
  另一方面，今年以来，资本市场已经给中国模型公司押下高额赌注，这一背景下，商业化就成了更现实的问题。
  公开数据显示，到今年8月，智谱的ARR（年化收入）约为16亿美元，其市销率高达46倍；尚未上市的DeepSeek，估值更是高达其预估年化收入的163倍。而大洋彼岸的 Anthropic，市销率约为 20 倍。中国模型公司在商业化上还有很长一段路要走。
  所以，中美模型竞争也出现了另一条主线：在继续追求 AGI，争夺模型能力上限的同时，谁能让性价比更高的模型完成更多真实任务、服务更多用户？谁能用高性价比的模型打开更大市场，创造更多营收？
   
  01 一场模型效率革命
  切换模型后，林舟的一大体验改善是模型的响应快多了。
  团队经常会需要几十个Agent同时写代码，他会边看进展边调整指令；发现方向不对，马上让模型修改。此前用Codex，他常要等模型输出一长段内容，才能插手纠正。“无论你是用CLI格式，还是用它原生的App，响应都要很长时间。”而一旦遇到长项目，模型需要整理此前的对话内容，使用GPT-5.6时，又要再多等上一阵。“但切换到V4.1 Flash后，你跟他说什么，他能立马反馈你。”
  今年以来，Scaling Law 仍是大模型研发的主线。今年发布的Qwen3.8-Max总参数达2.4T（T表示万亿个参数），Kimi K3达2.8T。按Elon Musk今年4月披露的对比推算，当时的Claude Opus约有5T，尽管Anthropic并未确认这一数字。
  这些超级模型固然触碰到了更高的智能，但更大的底座需要更多训练和部署资源；Agent场景下反复调用模型时，使用模型的成本也会指数级增加。
  换用V4.1 Flash后，林舟另一个明显的感受是调用成本大大下降。他举了团队做小应用的例子：一名同事独自完成开发，“差不多三四美金，就成了一个小App出来”。
  模型服务平台Requesty 8月的周榜单显示，DeepSeek V4 Flash占平台上实际Token用量约三分之一，排在所有模型首位。而在此前的第三方评测中，它与美国GPT-5.6 Luna高推理版本的综合得分接近，完成同组任务的成本低约六成。
  “模型公司也开始更多关注真实的市场需求，会更多去听开发者的声音。”一位基模研究员对智能涌现说。小模型一轮训练所需的时间和资源更少，能更快让用户看到他们用模型跑出来的东西是否可行，是否需要调整。“用小模型搞开发，可以更快地做版本迭代，更快拿认知。”
  而在日常工作中，这位研究员自己也会按任务需求来选模型。他举例说，修改实验脚本这类简单但工作量大的任务，交给GPT处理可能要20分钟，使用DeepSeek V4 Flash就只需要2分钟。“既然任务没有那么难，我就只希望模型赶紧把这件事情做完。”
  正是在这样的用户场景驱动下，近期各家发布的Flash模型大都在400B以下（B表示十亿个参数）：DeepSeek V4 Flash总参数284B；GLM-5.3-Flash总参数320B；Qwen3.8-Flash-Next的主模型为125B。
  “从训练的角度上来，300B和更大一些的模型，在能力上可能差不太多。”这位研究员说，自己做过不同尺寸的训练实验。在他使用的那批数据和训练方案下，约300B的模型已经能学进更大模型输出的长推理链。
  2025年发表于《Nature Machine Intelligence》的一项研究分析了51个开源模型，发现要在知识、推理、数学和代码等五项测试中取得相近成绩，所需的参数越来越少。研究者称之为“能力密度”提高：同样大小的模型，能做更多事。
  Qwen3.8-27B是一个近期例子。在Qwen公布的同组测试中，它在编程测试SWE-bench Pro中得61.7分，上一代同尺寸模型为53.5分；在长程办公测试CoWorkBench中得70.7分，上一代为61.0分。
  模型要解决的问题也随用户变化。这位研究员举例说，编程产品常回答程序员怎样写代码、管理项目；到了办公场景，问题变成了“我Excel的公式记不住怎么办”“怎么把这个论文写了”。
  底层工作仍可能是写代码，但实际要完成的工作复杂度可能是降低的。从Code到Work，一场模型的效率和成本革命正在发生。
   
  02 从“编程”到“日常办公”
  “我觉得会是两条路。”对当下Agent分化出的“编程”和“办公”两种产品，一位Code Agent创业者这样评价道。编程和办公产品都需要模型理解指令、写代码、调用工具，但面向的用户群体不同。他认为，面向普通人的办公产品，“一定需要的极致地省钱，极致的性价比。”
  今年1月，腾讯混元负责人姚顺雨在AGI-Next峰会上谈到用户需求的差别：企业做生产力任务时仍愿意使用能力最强的模型，但普通用户多数时候不需要。
  两类用户选模型的方式也不同。“程序员会自己分辨哪些任务用更贵的模型，哪些用更便宜的。”普通用户未必知道处理表格、撰写报告需要多强的模型。上述创业者说：“这是办公 Agent的产品经理要想办法去解决的问题。”
  今年1月，Anthropic推出Claude Cowork，让原本主要辅助写代码的Agent也能处理桌面办公任务。OpenAI随后推出ChatGPT Work，也是让用户直接交代一项工作，而不必在对话框里逐步提问。
  与此同时，国内产品也从编程走向办公。3月，腾讯云CodeBuddy团队推出WorkBuddy；8月，阿里整合QoderWork、悟空和MuleRun，推出千问办公；而在差不多时间，字节将飞书、TRAE Work等产品的办公能力整合到豆包，推出“豆包工作”。
  QuestMobile报告显示，2026年7月，腾讯WorkBuddy有658.2万月活跃用户；PC客户端用户当月人均使用19次。
  面对数百万用户反复交办的日常任务，办公Agent不能只按复杂编程的标准选模型。在一些WorkBuddy用户社区中，有用户这样评价DeepSeek V4 Flash和GLM-5.3-Flash：“有这两个Flash干活基本够用。”而在企业端，一位接近智谱的人士表示，GLM-5.3-Flash发布后，不少企业客户对这款总参数320B的模型表示出浓厚兴趣。
  而在真实的办公Agent使用场景里，执行任务的模型甚至可以更小，小到百亿级别。
  聚焦办公Agent的创业公司元空智能，已经在元空AI Work中用上几十B的模型。团队基于开源模型做后训练，让它处理更垂直的任务；通用任务则调用云端的混合模型。
  用户交办任务，产品替他选模型，这样的模式下，元空团队观察到用户其实对交互的速度十分敏感。一位团队成员说：“我们现在系统稍微慢一点点，一分钟之内一堆用户马上就找过来了。”
  事实上，一些办公任务甚至都不需要用到DeepSeek Flash的最高思考强度。一位元空团队成员说，这样做对他们的部分任务“其实是过剩的，会输出非常非常多Token，产生大量成本浪费”。
  元空智能在权衡任务效果和Token消耗，千问办公也把任务分成两档：标准模式处理日常办公，高级模式应对更难的问题。8月底，千问办公将Qwen3.8-Flash应用于标准模式。
  按千问办公公布的测试结果，标准模式完成单项任务的速度提高约一倍，平均Token消耗减少75%；这一模式可以完成其定义的约95%的日常任务，更难的任务则交给高级模式。
   
  03 更大，但也更卷的市场
  几个月前，美国创业公司Lindy宣布开始使用一款中国模型——把由平台管理的大部分日产工作Agent调用，从Claude Sonnet、Gemini切换到了DeepSeek V4 Flash。公司披露，切换后这部分调用的模型费用下降约九成。
  “这是公司成立以来，对成本结构影响最大的一次调整，产品质量没有受到影响。”Lindy的创始人Flo Crivello这样说道。
  8月下旬，一款名为Ox-Alpha的匿名模型进入海外编程Agent平台OpenCode和模型平台OpenRouter，立刻引起大范围讨论。
  美国编程Agent公司Cline拿自家代码库中的真实故障进行了测试：Ox-Alpha和另一款模型都修好了问题，但前者消耗的输出Token只有后者约三分之一。
  这款被中国用户戏称为“牛来”的模型，上线不到一周，仅在OpenCode就有约50万人使用；8月26日，智谱认领了这款模型——GLM-5.3-Flash。“牛来”模型与智谱的旗舰GLM-5.3形成了高低搭配——难题靠旗舰，日常任务则给 Flash 版本。
  开发者的免费试用只是第一步。显然，中国模型公司希望借Flash的能力和价格，进入全球Agent产品，让用户的更多日常任务转向自己的模型。
  这几乎是一个被 DeepSeek 带起来的市场。全球范围内，DeepSeek在V4 Flash发布后调用量一直居高不下。OpenRouter6月数据显示，DeepSeek占该平台Token用量的份额，从年初的9%升至6月初的18%；增长主要来自Agent任务。到5月底，V4 Flash已占DeepSeek系列Agent任务Token用量的70%。
  DeepSeek 让其他模型厂商看到，在300B-500B区间的Flash模型，有着巨大市场潜力——这是一个被拓宽出来的新市场。
  不同类型的模型去打不同定位的市场，模型厂商赚钱的概率也会提升。
  从市场角度看，旗舰模型和Flash模型正在形成不同的战场。但是在大模型研发团队看来，这似乎又并非是两个对立的策略。
  一位业内人士表示，旗舰模型仍有继续训练的价值。他把它比作车企的赛车：“它不一定能量产，但会有一些技术下放。”在他看来，旗舰探索出来的能力和训练经验，最终可以进入服务更广泛用户的小模型。
  比如，智谱上周披露，一个由GLM-5.3驱动的Infra Agent，参与了GLM-5.3-Flash推理服务的搭建与优化，并成功将GLM-5.3-Flash部署到了国产芯片上。从初步适配到投入生产，不到两周；经过优化，同一套服务处理请求的能力提高到最初的约三倍。
  另一方面，Flash模型也成了下一代模型的试验场。Qwen先在Qwen3.8-Flash-Next上使用计划用于Qwen4的新架构；据团队介绍，这款模型的训练算力消耗约为Qwen3.7-Plus的九分之一。
  这场竞争不只发生在中国厂商之间，美国模型公司也参与了进来。
  价格战已经打响。
  7月，OpenAI将较轻量的GPT-5.6 Luna价格下调80%。在OpenAI公布的客户反馈里，美国办公Agent公司Dust称，换用Luna处理同类任务后，速度提高了40%，费用降低了40%。显然，在全球范围内，模型厂商们都在试图用更小的模型，凭借速度和价格优势争取到的Agent客户。
  OpenAI 首席财务官Sarah Friar写道：“只要质量够用，低价模型就会被用于更多任务。” 而“模型处理更多任务”给模型公司带来的收入反馈，我们或将在下一个季度见到。
  *文中林舟为化名

文 | 李炤锋 王欣逸
  编辑 | 张雨忻
   
  在深圳，林舟所在的AI创业公司只有十个人，大部分工作都靠 AI 来完成——每天数百个Agent（智能体）同时运行，它们分头写代码、做研究。
  而驱动这些Agent的，一直都是OpenAI的GPT系列模型。
  但随着团队交给Agent的任务越来越多，林舟发现GPT跟不上了——他们当时使用的GPT5.6，一次只能同时处理两三个任务。“GPT能处理的并发任务有限，会耽误我们的工作进度。”林舟说，团队开始寻找能让更多任务同时运行、调用价格也更低的模型。
  DeepSeek V4.1 Flash成了新选择。9月以来，团队试用了Claude和几款国产模型，最后选中V4.1 Flash：它能完成手头的开发任务，反馈更快，调用费用也更低。林舟说，这是他们眼下“性价比最高”的选择。
  今年更早的时候，Google CEO Sundar Pichai在 Google I/O大会上说，据他了解，有些公司到了5月，全年Token预算就已经快用完了。就以Google自己为例，其内部AI编程工具每天消耗的Token也从3月的5000亿涨到5 月的超过3万亿。
  而就是在这次大会上，Google推出了速度更快、成本也更低的Gemini 3.5 Flash，瞄准更日常的开发和工作场景——今年以来，OpenClaw掀起的“龙虾”热潮，让普通用户也开始用Agent处理各种工作事务，这是比编程更日常、更低门槛、更高频的需求。
  与此同时，越来越多的小参数模型开始出现。因为任务越来越多，模型的调用也会更频繁，若使用几千亿甚至两三万亿参数的旗舰模型，用户要承担的费用会非常高；并且大参数模型的速度也快不起来，会大大增加用户的等待时间。
  模型厂商，尤其是中国模型厂商，接连推出Flash版本的小参数模型，争的正是这批过去也在由旗舰模型完成日常需求。Flash，意为“闪电”。模型厂商通常用这样的命名来表示更快、价格更低的模型版本：它每次运行调用的参数较少，适合用来反复处理日常任务；而复杂问题仍可交给Pro等旗舰模型。
  7月31日，DeepSeek发布V4 Flash正式版；8月26日，阿里Qwen团队的Qwen3.8-Flash-Next与智谱的GLM-5.3-Flash同日亮相；9月，DeepSeek又推出V4.1 Flash。这几款模型参数大小不一，均在千亿级别（从100B-500B的参数区间），远小于当前的旗舰模型万亿级别的参数。
  两个月前，当DeepSeek V4 Flash正式发布后，有开发者把它的评测成绩和完成任务的成本画在一张图上，提出所谓“斩杀线”：那些性能不如V4 Flash，做同样的任务却更贵的模型，就这样被“斩杀”。
  灰色区域内的模型被 DeepSeek V4 Flash “斩杀”，来源：Artificial Analysis
  8月下旬，美国编程Agent平台Cline开始免费提供一款未公布身份的模型。Cline称，不到一周，这款模型承担了平台超过11%的推理量。随后，智谱认领了这款模型，正是后来推出的 GLM-5.3-Flash。此前，智谱创始人唐杰在业绩会上谈到下一代模型，他说，公司“不会做一个大而无用的模型”。
  事实上，“小模型”阵营还在不断扩大。智能涌现了解到，月之暗面和腾讯混元，都在推动Flash模型版本的开发。
  另一方面，今年以来，资本市场已经给中国模型公司押下高额赌注，这一背景下，商业化就成了更现实的问题。
  公开数据显示，到今年8月，智谱的ARR（年化收入）约为16亿美元，其市销率高达46倍；尚未上市的DeepSeek，估值更是高达其预估年化收入的163倍。而大洋彼岸的 Anthropic，市销率约为 20 倍。中国模型公司在商业化上还有很长一段路要走。
  所以，中美模型竞争也出现了另一条主线：在继续追求 AGI，争夺模型能力上限的同时，谁能让性价比更高的模型完成更多真实任务、服务更多用户？谁能用高性价比的模型打开更大市场，创造更多营收？
   
  01 一场模型效率革命
  切换模型后，林舟的一大体验改善是模型的响应快多了。
  团队经常会需要几十个Agent同时写代码，他会边看进展边调整指令；发现方向不对，马上让模型修改。此前用Codex，他常要等模型输出一长段内容，才能插手纠正。“无论你是用CLI格式，还是用它原生的App，响应都要很长时间。”而一旦遇到长项目，模型需要整理此前的对话内容，使用GPT-5.6时，又要再多等上一阵。“但切换到V4.1 Flash后，你跟他说什么，他能立马反馈你。”
  今年以来，Scaling Law 仍是大模型研发的主线。今年发布的Qwen3.8-Max总参数达2.4T（T表示万亿个参数），Kimi K3达2.8T。按Elon Musk今年4月披露的对比推算，当时的Claude Opus约有5T，尽管Anthropic并未确认这一数字。
  这些超级模型固然触碰到了更高的智能，但更大的底座需要更多训练和部署资源；Agent场景下反复调用模型时，使用模型的成本也会指数级增加。
  换用V4.1 Flash后，林舟另一个明显的感受是调用成本大大下降。他举了团队做小应用的例子：一名同事独自完成开发，“差不多三四美金，就成了一个小App出来”。
  模型服务平台Requesty 8月的周榜单显示，DeepSeek V4 Flash占平台上实际Token用量约三分之一，排在所有模型首位。而在此前的第三方评测中，它与美国GPT-5.6 Luna高推理版本的综合得分接近，完成同组任务的成本低约六成。
  “模型公司也开始更多关注真实的市场需求，会更多去听开发者的声音。”一位基模研究员对智能涌现说。小模型一轮训练所需的时间和资源更少，能更快让用户看到他们用模型跑出来的东西是否可行，是否需要调整。“用小模型搞开发，可以更快地做版本迭代，更快拿认知。”
  而在日常工作中，这位研究员自己也会按任务需求来选模型。他举例说，修改实验脚本这类简单但工作量大的任务，交给GPT处理可能要20分钟，使用DeepSeek V4 Flash就只需要2分钟。“既然任务没有那么难，我就只希望模型赶紧把这件事情做完。”
  正是在这样的用户场景驱动下，近期各家发布的Flash模型大都在400B以下（B表示十亿个参数）：DeepSeek V4 Flash总参数284B；GLM-5.3-Flash总参数320B；Qwen3.8-Flash-Next的主模型为125B。
  “从训练的角度上来，300B和更大一些的模型，在能力上可能差不太多。”这位研究员说，自己做过不同尺寸的训练实验。在他使用的那批数据和训练方案下，约300B的模型已经能学进更大模型输出的长推理链。
  2025年发表于《Nature Machine Intelligence》的一项研究分析了51个开源模型，发现要在知识、推理、数学和代码等五项测试中取得相近成绩，所需的参数越来越少。研究者称之为“能力密度”提高：同样大小的模型，能做更多事。
  Qwen3.8-27B是一个近期例子。在Qwen公布的同组测试中，它在编程测试SWE-bench Pro中得61.7分，上一代同尺寸模型为53.5分；在长程办公测试CoWorkBench中得70.7分，上一代为61.0分。
  模型要解决的问题也随用户变化。这位研究员举例说，编程产品常回答程序员怎样写代码、管理项目；到了办公场景，问题变成了“我Excel的公式记不住怎么办”“怎么把这个论文写了”。
  底层工作仍可能是写代码，但实际要完成的工作复杂度可能是降低的。从Code到Work，一场模型的效率和成本革命正在发生。
   
  02 从“编程”到“日常办公”
  “我觉得会是两条路。”对当下Agent分化出的“编程”和“办公”两种产品，一位Code Agent创业者这样评价道。编程和办公产品都需要模型理解指令、写代码、调用工具，但面向的用户群体不同。他认为，面向普通人的办公产品，“一定需要的极致地省钱，极致的性价比。”
  今年1月，腾讯混元负责人姚顺雨在AGI-Next峰会上谈到用户需求的差别：企业做生产力任务时仍愿意使用能力最强的模型，但普通用户多数时候不需要。
  两类用户选模型的方式也不同。“程序员会自己分辨哪些任务用更贵的模型，哪些用更便宜的。”普通用户未必知道处理表格、撰写报告需要多强的模型。上述创业者说：“这是办公 Agent的产品经理要想办法去解决的问题。”
  今年1月，Anthropic推出Claude Cowork，让原本主要辅助写代码的Agent也能处理桌面办公任务。OpenAI随后推出ChatGPT Work，也是让用户直接交代一项工作，而不必在对话框里逐步提问。
  与此同时，国内产品也从编程走向办公。3月，腾讯云CodeBuddy团队推出WorkBuddy；8月，阿里整合QoderWork、悟空和MuleRun，推出千问办公；而在差不多时间，字节将飞书、TRAE Work等产品的办公能力整合到豆包，推出“豆包工作”。
  QuestMobile报告显示，2026年7月，腾讯WorkBuddy有658.2万月活跃用户；PC客户端用户当月人均使用19次。
  面对数百万用户反复交办的日常任务，办公Agent不能只按复杂编程的标准选模型。在一些WorkBuddy用户社区中，有用户这样评价DeepSeek V4 Flash和GLM-5.3-Flash：“有这两个Flash干活基本够用。”而在企业端，一位接近智谱的人士表示，GLM-5.3-Flash发布后，不少企业客户对这款总参数320B的模型表示出浓厚兴趣。
  而在真实的办公Agent使用场景里，执行任务的模型甚至可以更小，小到百亿级别。
  聚焦办公Agent的创业公司元空智能，已经在元空AI Work中用上几十B的模型。团队基于开源模型做后训练，让它处理更垂直的任务；通用任务则调用云端的混合模型。
  用户交办任务，产品替他选模型，这样的模式下，元空团队观察到用户其实对交互的速度十分敏感。一位团队成员说：“我们现在系统稍微慢一点点，一分钟之内一堆用户马上就找过来了。”
  事实上，一些办公任务甚至都不需要用到DeepSeek Flash的最高思考强度。一位元空团队成员说，这样做对他们的部分任务“其实是过剩的，会输出非常非常多Token，产生大量成本浪费”。
  元空智能在权衡任务效果和Token消耗，千问办公也把任务分成两档：标准模式处理日常办公，高级模式应对更难的问题。8月底，千问办公将Qwen3.8-Flash应用于标准模式。
  按千问办公公布的测试结果，标准模式完成单项任务的速度提高约一倍，平均Token消耗减少75%；这一模式可以完成其定义的约95%的日常任务，更难的任务则交给高级模式。
   
  03 更大，但也更卷的市场
  几个月前，美国创业公司Lindy宣布开始使用一款中国模型——把由平台管理的大部分日产工作Agent调用，从Claude Sonnet、Gemini切换到了DeepSeek V4 Flash。公司披露，切换后这部分调用的模型费用下降约九成。
  “这是公司成立以来，对成本结构影响最大的一次调整，产品质量没有受到影响。”Lindy的创始人Flo Crivello这样说道。
  8月下旬，一款名为Ox-Alpha的匿名模型进入海外编程Agent平台OpenCode和模型平台OpenRouter，立刻引起大范围讨论。
  美国编程Agent公司Cline拿自家代码库中的真实故障进行了测试：Ox-Alpha和另一款模型都修好了问题，但前者消耗的输出Token只有后者约三分之一。
  这款被中国用户戏称为“牛来”的模型，上线不到一周，仅在OpenCode就有约50万人使用；8月26日，智谱认领了这款模型——GLM-5.3-Flash。“牛来”模型与智谱的旗舰GLM-5.3形成了高低搭配——难题靠旗舰，日常任务则给 Flash 版本。
  开发者的免费试用只是第一步。显然，中国模型公司希望借Flash的能力和价格，进入全球Agent产品，让用户的更多日常任务转向自己的模型。
  这几乎是一个被 DeepSeek 带起来的市场。全球范围内，DeepSeek在V4 Flash发布后调用量一直居高不下。OpenRouter6月数据显示，DeepSeek占该平台Token用量的份额，从年初的9%升至6月初的18%；增长主要来自Agent任务。到5月底，V4 Flash已占DeepSeek系列Agent任务Token用量的70%。
  DeepSeek 让其他模型厂商看到，在300B-500B区间的Flash模型，有着巨大市场潜力——这是一个被拓宽出来的新市场。
  不同类型的模型去打不同定位的市场，模型厂商赚钱的概率也会提升。
  从市场角度看，旗舰模型和Flash模型正在形成不同的战场。但是在大模型研发团队看来，这似乎又并非是两个对立的策略。
  一位业内人士表示，旗舰模型仍有继续训练的价值。他把它比作车企的赛车：“它不一定能量产，但会有一些技术下放。”在他看来，旗舰探索出来的能力和训练经验，最终可以进入服务更广泛用户的小模型。
  比如，智谱上周披露，一个由GLM-5.3驱动的Infra Agent，参与了GLM-5.3-Flash推理服务的搭建与优化，并成功将GLM-5.3-Flash部署到了国产芯片上。从初步适配到投入生产，不到两周；经过优化，同一套服务处理请求的能力提高到最初的约三倍。
  另一方面，Flash模型也成了下一代模型的试验场。Qwen先在Qwen3.8-Flash-Next上使用计划用于Qwen4的新架构；据团队介绍，这款模型的训练算力消耗约为Qwen3.7-Plus的九分之一。
  这场竞争不只发生在中国厂商之间，美国模型公司也参与了进来。
  价格战已经打响。
  7月，OpenAI将较轻量的GPT-5.6 Luna价格下调80%。在OpenAI公布的客户反馈里，美国办公Agent公司Dust称，换用Luna处理同类任务后，速度提高了40%，费用降低了40%。显然，在全球范围内，模型厂商们都在试图用更小的模型，凭借速度和价格优势争取到的Agent客户。
  OpenAI 首席财务官Sarah Friar写道：“只要质量够用，低价模型就会被用于更多任务。” 而“模型处理更多任务”给模型公司带来的收入反馈，我们或将在下一个季度见到。
  *文中林舟为化名

[Оригинал](https://eu.36kr.com/zh/p/3991436755057415)