# 平均6天一个新旗舰！大模型更新快到人类跟不上了|Anthropic|Claude Opus 5|GPT-6|OpenAI|ChatGPT_手机新浪网 - finance.sina.com.cn

*Источник: finance.sina.com.cn*
*Дата: 2026-09-26*
*Язык: zh*

**Кратко:** 平均6天一个新旗舰！大模型更新快到人类跟不上了
（来源：新智元）
新智元报道
太疯狂了，短短两天，竟然冒出了4个新模型！
前脚，老马的xAI才刚发完Grok 4.7。
紧接着，OpenAI突然甩出GPT-6 Sol和Luna，价格直接腰斩。同一天，Anthropic也把Claude Opus 5.5拍在了桌上，比上一代硬生生便宜40%。
9月22日，一张动图在X上被转疯，浏览量狂飙近百万。
2023年，大模型73天一更，到了2026年，18天一更。
从ChatGPT上线算起，OpenAI和Anthropic已经狂轰滥炸了42个重磅模型（算上当天发的GPT-6 Sol和Luna是44个）。
几小时后，Stability AI创始人Emad Mostaque转发了这张图，还加了一句预言。
「就像Alex说的，照这个速度，明年年初就是每天一个。」
两大巨头，卷出「半月一更」
其实，「18天一更」这个数还算保守，因为它只算了OpenAI和Anthropic两家。
今年初到9月22日，Anthropic发了8个旗舰模型，OpenAI发了6个，14个模型摊进265天，平均19天一个。
同一时间段里，国内十家主要大模型厂商又发了至少28个旗舰，平均9天多一个。
有几回还是扎堆发的，春节前一周，4家接连甩出新旗舰；4月20日到24日，5天里又是4家轮番上阵。
两边加在一起，平均6天多就冒出一个新旗舰，离Emad说的「一天一个」已经不算远了。
Anthropic的提速肉眼可见。
上半年它平均46天发一个模型，下半年压到了26天。Opus 4.8是5月28日，Opus 5是7月24日，Opus 5.5是9月22日。
OpenAI走的则是「憋大招，然后一套带走」的路线。
9月3日GPT-6 Astra刚把全网炸翻，才隔了19天，Sol和Luna就跟着下场。
下周还有DevDay大会，Altman感慨，这是他记忆里OpenAI头一回在备战发布会时喊出「要发的东西太多了」。
发布为什么越来越密，Anthropic在一份报告里给出了答案，AI已经在帮着造下一代AI。
今年2月，Claude能独立主导的AI研发工作还不到1%，之后几乎一个月上一个台阶，5月12%，7月22%，到了8月已经达到了26%。
OpenAI那边，截至8月中旬，AI智能体投入的工作日，已经是人类研究员的3.1倍（按每天8小时折算）。
在Anthropic，造模型的活，四分之一已经交给了Claude自己。下一个模型，只会一个接一个地来。
排队的已经堵到了门口。Anthropic的Mike Krieger放话，Sonnet 5.5和Haiku 5.5未来几周就到。
谷歌的Gemini 4早在7月就开始了「迄今最有野心的一次预训练」，外界普遍押在年底前后亮相。国内也至少有两家官宣了下一代旗舰，只差一个发布日期。
辛辛苦苦攒的「玄学」
两个月直接报废
大模型跑得越快，在下游写代码的人就越狼狈。
你7月底熬了几个通宵，刚把应用迁到Opus 5，参数一项项调得如丝般顺滑。两个月后Opus 5.5横空出世，你满心欢喜地一换接口——咔，一部分请求直接报错。
把这两家最近的官方提示词指南翻一遍，会发现他们在传达同一个事实，你给上一代模型写的那些祖传Prompt，很多都成了废纸。
头一件事是做减法。
OpenAI在Astra指南里明说，以前太细的流程指令，现在反而会拖后腿，「改代码前先通读文档」「切记跑测试」这种话，统统可以删掉。
Anthropic的指南也是这个意思。
以前的提示词里常要加一句「做完检查一遍」，可Opus 5已经会自己检查，这句不删，它反而会过度检查。
到了Opus 5.5，聊天场景里「回答前仔细想想」这种PUA话术也建议删掉，删了之后回复快了，质量也没有明显下降。
删完旧的，还得补新的，因为每一代都有新脾气。
Opus 5.5在多轮对话里老爱回头琢磨已经答完的问题，白白浪费算力，官方给了一句补丁，「已经答过的，就当过去了。」
参数和默认值也在悄悄变。
在Opus 5.5上，关掉思考模式的写法直接报错400；不写effort参数，默认档位从high降到了medium，成本和效果跟着洗牌。
对此，官方的建议是重新跑一遍effort测试，别把Opus 5的老设置直接搬过来。
一套提示词加一套参数，每一代都得扒层皮。调没调过，账单能差出一大截。
Anthropic的Lance Martin在视频里演示过，一份给Opus 4.8写的老提示词，每张工单成本2.45美分，直接换上Opus 5.5是2.02美分；再用官方工具洗一遍，准确率拉到92.0%，成本压到了1.83美分。
除了这些，模型本身的寿命也在缩短。
今年OpenAI已经发了9次弃用公告，涉及40多个模型和功能。
其中，4月23日刚发的GPT-5.5，10月14日就要从ChatGPT和Codex下架，活了不到半年。
甚至，就连 OpenAI自家的Evals评测平台，也要在11月底关门。
刷榜？一套新考题，半年就被锤穿了
人跟不上就算了，现在连「考卷」都不够用了。
今年3月，号称专治AI、考智商不考背题的ARC-AGI-3上线。当时排第一的Gemini 3.1 Pro只拿了0.37%，人类是100%。
9月3日，GPT-6 Astra杀进考场，标准测试拿下62.7%，换上特定框架直接到了99.9%。在96%的关卡里，它用的步数比人类还少。
一套新考题，半年就被打穿，ARC官方已经开始琢磨下一代评测该怎么出。
写代码榜单（Next.js）上，Sol、Opus 5.5和Fable 5.1全是97%，并列第一；写作榜单上，Opus 5.5断层领先第二名307分。
这一分数是榜单有史以来最大的一次单次跳跃，博主看完直呼离谱，差点以为是自己的基准出了bug！
新模型每来一个，开发者就得像西西弗斯一样，把测试流程从头再推一遍。
照现在这个节奏，明年要是真到了「一天一更」的地步，你今天调好的提示词、配好的Agent链路，寿命可能都撑不过一个星期。
模型换代的速度，第一次彻底超过了人类适应它的速度。
如今跑得最慢的，竟然是使用AI的人。
参考资料：
https://x.com/EMostaque/status/2102614902393241950?s=20
编辑：摩西

平均6天一个新旗舰！大模型更新快到人类跟不上了
（来源：新智元）
新智元报道
太疯狂了，短短两天，竟然冒出了4个新模型！
前脚，老马的xAI才刚发完Grok 4.7。
紧接着，OpenAI突然甩出GPT-6 Sol和Luna，价格直接腰斩。同一天，Anthropic也把Claude Opus 5.5拍在了桌上，比上一代硬生生便宜40%。
9月22日，一张动图在X上被转疯，浏览量狂飙近百万。
2023年，大模型73天一更，到了2026年，18天一更。
从ChatGPT上线算起，OpenAI和Anthropic已经狂轰滥炸了42个重磅模型（算上当天发的GPT-6 Sol和Luna是44个）。
几小时后，Stability AI创始人Emad Mostaque转发了这张图，还加了一句预言。
「就像Alex说的，照这个速度，明年年初就是每天一个。」
两大巨头，卷出「半月一更」
其实，「18天一更」这个数还算保守，因为它只算了OpenAI和Anthropic两家。
今年初到9月22日，Anthropic发了8个旗舰模型，OpenAI发了6个，14个模型摊进265天，平均19天一个。
同一时间段里，国内十家主要大模型厂商又发了至少28个旗舰，平均9天多一个。
有几回还是扎堆发的，春节前一周，4家接连甩出新旗舰；4月20日到24日，5天里又是4家轮番上阵。
两边加在一起，平均6天多就冒出一个新旗舰，离Emad说的「一天一个」已经不算远了。
Anthropic的提速肉眼可见。
上半年它平均46天发一个模型，下半年压到了26天。Opus 4.8是5月28日，Opus 5是7月24日，Opus 5.5是9月22日。
OpenAI走的则是「憋大招，然后一套带走」的路线。
9月3日GPT-6 Astra刚把全网炸翻，才隔了19天，Sol和Luna就跟着下场。
下周还有DevDay大会，Altman感慨，这是他记忆里OpenAI头一回在备战发布会时喊出「要发的东西太多了」。
发布为什么越来越密，Anthropic在一份报告里给出了答案，AI已经在帮着造下一代AI。
今年2月，Claude能独立主导的AI研发工作还不到1%，之后几乎一个月上一个台阶，5月12%，7月22%，到了8月已经达到了26%。
OpenAI那边，截至8月中旬，AI智能体投入的工作日，已经是人类研究员的3.1倍（按每天8小时折算）。
在Anthropic，造模型的活，四分之一已经交给了Claude自己。下一个模型，只会一个接一个地来。
排队的已经堵到了门口。Anthropic的Mike Krieger放话，Sonnet 5.5和Haiku 5.5未来几周就到。
谷歌的Gemini 4早在7月就开始了「迄今最有野心的一次预训练」，外界普遍押在年底前后亮相。国内也至少有两家官宣了下一代旗舰，只差一个发布日期。
辛辛苦苦攒的「玄学」
两个月直接报废
大模型跑得越快，在下游写代码的人就越狼狈。
你7月底熬了几个通宵，刚把应用迁到Opus 5，参数一项项调得如丝般顺滑。两个月后Opus 5.5横空出世，你满心欢喜地一换接口——咔，一部分请求直接报错。
把这两家最近的官方提示词指南翻一遍，会发现他们在传达同一个事实，你给上一代模型写的那些祖传Prompt，很多都成了废纸。
头一件事是做减法。
OpenAI在Astra指南里明说，以前太细的流程指令，现在反而会拖后腿，「改代码前先通读文档」「切记跑测试」这种话，统统可以删掉。
Anthropic的指南也是这个意思。
以前的提示词里常要加一句「做完检查一遍」，可Opus 5已经会自己检查，这句不删，它反而会过度检查。
到了Opus 5.5，聊天场景里「回答前仔细想想」这种PUA话术也建议删掉，删了之后回复快了，质量也没有明显下降。
删完旧的，还得补新的，因为每一代都有新脾气。
Opus 5.5在多轮对话里老爱回头琢磨已经答完的问题，白白浪费算力，官方给了一句补丁，「已经答过的，就当过去了。」
参数和默认值也在悄悄变。
在Opus 5.5上，关掉思考模式的写法直接报错400；不写effort参数，默认档位从high降到了medium，成本和效果跟着洗牌。
对此，官方的建议是重新跑一遍effort测试，别把Opus 5的老设置直接搬过来。
一套提示词加一套参数，每一代都得扒层皮。调没调过，账单能差出一大截。
Anthropic的Lance Martin在视频里演示过，一份给Opus 4.8写的老提示词，每张工单成本2.45美分，直接换上Opus 5.5是2.02美分；再用官方工具洗一遍，准确率拉到92.0%，成本压到了1.83美分。
除了这些，模型本身的寿命也在缩短。
今年OpenAI已经发了9次弃用公告，涉及40多个模型和功能。
其中，4月23日刚发的GPT-5.5，10月14日就要从ChatGPT和Codex下架，活了不到半年。
甚至，就连 OpenAI自家的Evals评测平台，也要在11月底关门。
刷榜？一套新考题，半年就被锤穿了
人跟不上就算了，现在连「考卷」都不够用了。
今年3月，号称专治AI、考智商不考背题的ARC-AGI-3上线。当时排第一的Gemini 3.1 Pro只拿了0.37%，人类是100%。
9月3日，GPT-6 Astra杀进考场，标准测试拿下62.7%，换上特定框架直接到了99.9%。在96%的关卡里，它用的步数比人类还少。
一套新考题，半年就被打穿，ARC官方已经开始琢磨下一代评测该怎么出。
写代码榜单（Next.js）上，Sol、Opus 5.5和Fable 5.1全是97%，并列第一；写作榜单上，Opus 5.5断层领先第二名307分。
这一分数是榜单有史以来最大的一次单次跳跃，博主看完直呼离谱，差点以为是自己的基准出了bug！
新模型每来一个，开发者就得像西西弗斯一样，把测试流程从头再推一遍。
照现在这个节奏，明年要是真到了「一天一更」的地步，你今天调好的提示词、配好的Agent链路，寿命可能都撑不过一个星期。
模型换代的速度，第一次彻底超过了人类适应它的速度。
如今跑得最慢的，竟然是使用AI的人。
参考资料：
https://x.com/EMostaque/status/2102614902393241950?s=20
编辑：摩西

[Оригинал](https://finance.sina.cn/stock/jdts/2026-09-26/detail-initccvk8843571.d.html?oid=800&vt=4&cid=76993&node_id=76993)