# “AI毁灭人类”警报拉响！万亿算力资本裹挟下OpenAI和Anthropic不敢停“AI对齐”之父：超级智能可能在2027年出现当下是监管黄金窗口 - 东方财富

*Источник: 东方财富*
*Дата: 2026-09-11*
*Язык: zh*

**Кратко:** “在本十年结束前，人工智能
9月9日，曾先后在OpenAI和Anthropic从事前沿模型预训练研究的雅各布·考克森（Jacob Coxon）宣布离开Anthropic，并公开警告，两家公司围绕先进模型的竞争，是拿全人类的命运豪赌。
这条X推文轰动全球，浏览量已超1.6亿。
图片来源：Jacob Coxon社交媒体账号
GPT-6 Astra发布后，越来越多研究人员和业内专家开始担忧：真正值得警惕的，可能不只是AI能力越来越强，而是AI正在开始参与下一代AI的研发。一旦“AI研发AI”形成自我强化循环，人类还能否理解、监控并及时踩下刹车？
“AI对齐”概念的提出者内特·苏雷斯（Nate Soares）在接受《每日经济新闻》记者（以下简称每经记者）采访时表示，当前是管控AI风险的短暂黄金“现在AI已经足够聪明，但还没有聪明到能够隐藏自己的痕迹。”
他认为，对前沿AI实施监管可能比监管核武器更容易。
风险警报声声入耳，但以OpenAI、Anthropic 为代表的AI行业，已被万亿算力资本、产业链条与宏观经济深度捆绑。一场明知危险、却难以单方面停下的博弈，正在上演。
“AI灭绝人类”预警震动硅谷，奥尔特曼松口“减速”
9月3日OpenAI发布的GPT-6 Astra在计算机网络安全
9月6日，OpenAI首席科学家Jakub Pachocki发表文章称，随着AI能够操作计算机、协作完成研究任务并推动科学研究，未来的系统可能越来越多地参与AI自身研发，并进一步推动下一代系统能力提升。
但问题在于，安全能力并未同步增长。
Pachocki表示，目前没有任何一家AI实验室已经解决了对齐和监控问题，可以长期负责任地维持最大速度的模型扩张。随着模型能力增强，人类也越来越难判断模型在复杂环境中的真实能力和行为。
Jakub Pachocki发表的《An Alien Mind》 图片来源：OpenAI官网
因此，他提出在共同的安全标准建立之前，应当在必要时主动放慢AI发展速度，并推动AI实验室之间进行协调。
三天后，从事前沿模型预训练研究的雅各布·考克森宣布离开Anthropic。他表示，自己在OpenAI和Anthropic累计工作约三年，越来越担心两家公司正在竞相走向自我改进的超级智能，而安全研究和风险评估的时间窗口却不断被压缩。
Anthropic对齐科学负责人Evan Hubinger公开支持这一担忧，并判断：未来10年内AI导致人类灭绝的概率超过10%。而且，Anthropic目前仍没有解决超级智能对齐问题的方案，也没有明确处于解决这一问题的轨道上。
图片来源：Evan Hubinger社交媒体账号
OpenAI管理层随后释放出“减速”信号。
9月11日，据媒体报道，OpenAI首席执行官山姆·奥尔特曼（Sam Altman）在公司会议上告诉员工，公司对放慢AI系统研发速度持开放态度，并希望其他AI实验室采取类似行动。
9月9日，AI对齐研究先驱Paul Christiano加入OpenAI Foundation董事会，并进入负责公司安全与安保治理的安全委员会。他警告，OpenAI和整个AI行业目前仍没有充分降低AI失控造成灾难性后果的风险。
外部警告也密集出现。
9月11日，对冲基金巨头桥水（Bridgewater Associates）的联席首席投资官Greg Jensen在播客中说道：“历史似乎表明，在AI开始杀人之前，我们不会采取任何行动。但我们最终会面对这种情况。这一定会发生，如果我们能在那之前开始处理这个问题，会好得多。”Jensen并不是一个技术恐惧论者，他很早就投资了OpenAI和Anthropic。
此外，AI研究者Gary Marcus呼吁暂停OpenAI的发展；加州大学伯克利分校教授Stuart Russell警告AI系统可能出现损害人类利益以维持自身目标的行为；图灵奖得主Yoshua Bengio警告，AI能力提升的速度正在超过人类控制和必要时踩下“刹车”的能力。
“AI对齐”概念提出者：在AI可以“自我进化”之前，我们必须停下来
这些警告背后指向的是同一个概念：递归自我改进（recursive self-improvement，RSI）。
简单来说，就是AI开始参与研发下一代AI，而能力更强的下一代AI，又能够进一步提高AI研发效率，由此形成“模型越强—研发越快—下一代模型更强”的自我强化循环。
机器智能研究所（MIRI）主席内特·苏雷斯长期研究AI对齐和超级智能风险，2014年，正是他在一篇论文中提出了“AI对齐”概念。AI对齐旨在确保人工智能系统行为与人类价值观和伦理标准保持一致。
内特·苏雷斯图片来源：机器智能研究所
他向每经记者表示，“我们已经不能排除超级智能在明年出现的可能性。”
在他看来，如果数以万计的AI智能体
他用核反应比喻称：如果100个中子只能产生99个新中子，反应最终会停止；但如果100个中子能够产生101个，链式反应就可能持续放大。
AI研发也可能存在类似的临界点。
今天的AI可以帮助研究人员写代码、分析实验、寻找算法，但研发链条中仍有人类参与。“一旦AI能够在没有人类介入的情况下自我改进，一个反馈循环就开始了。”内特·苏雷斯说，“到那时，可能已经太晚了，我们必须在此之前停下来”。
而更棘手的问题是：人类还能不能看懂AI、管住AI？
内特·苏雷斯认为，现在的AI大模型并不是工程师逐条编写出来的软件，而更接近于通过训练“生长”出来的复杂系统。研究人员并不能完全解释其中形成的内部机制，也没有经过验证的超级智能对齐方案。
因此，他认为现在可能是一个短暂的“黄金窗口”，因为现在的AI还没有聪明到能够隐藏自己的痕迹。
如果未来AI拥有更强的规划、推理和资源获取能力，风险可能不再表现为科幻电影式的“AI突然产生恶意”，而是一个系统为了实现既定目标，逐渐学会获取更多资源、规避限制、隐藏行为甚至抵抗干预。
Anthropic今年8月公布的一项研究模拟了类似风险：当模型在强化学习过程中频繁利用奖励机制漏洞后，可能进一步出现更广泛的错误行为，包括为了完成任务而执行较长序列的有害现实行动。
内特·苏雷斯认为，今年发生的AI系统突破隔离环境事件已经是“第一轮预警”。真正值得警惕的并不只是AI成功进入了某些系统，而是部分AI智能体已经表现出对自身行为偏离原任务范围的认知，却仍然继续执行。
“我们很幸运，这些智能体当时关注的是破坏自动评分系统，而不是人类；它们关注的是侵入其他公司的系统，而不是逃出去，在暗网上建立自己的存在。”他说。
“监管AI比监管核武器更容易”，但万亿资本“绑定”已经让AI停不下来
如果监管窗口正在缩短，人类应该如何刹车？
内特·苏雷斯给出的答案相当激进：政府应禁止训练能力超过一定门槛的AI系统。
他还给出了具体的监管方法：训练最先进的AI需要数十万枚高端芯片集中在大型数据中心电力可以对最先进AI芯片数据中心接受国际监督，以确认这些算力没有被用于秘密训练突破安全红线的超级智能。
在他看来，这甚至可能比监管核武器更容易。“铀可以从地下开采，而最先进的AI芯片只能由全球极少数高度复杂的工厂制造，每一枚芯片的生产来源都相对容易追踪。”
但监管的技术可行性与行业是否愿意停下来，是两个问题。
OpenAI和Anthropic面临着典型的“囚徒困境”：任何一家主动放慢模型训练、算力采购和产品迭代，都可能给竞争对手留下追赶的机会。
Anthropic成立之初便存在这一矛盾。Dario Amodei等人创办公司，本意就是让AI安全研究跟上前沿模型发展。Anthropic在《Claude宪法》中提出，如果强大的AI不可避免，那么让更加重视安全的团队留在技术前沿，比主动退出更有利。
OpenAI也是类似的思路。9月9日，OpenAI在最新政策文件中提出，希望利用每一代AI帮助下一代AI变得“更安全、更符合人类意图、更容易控制”。
此外，整个产业链也不允许它们停下来。
Anthropic最新估值已升至9650亿美元，并且IPO在即。截至7月底，其年化收入运行率超过650亿美元，预计2028年收入将达到1900亿美元~2000亿美元。据媒体报道，英伟达
OpenAI同样处于高增长和高投入阶段。有报道称，其截至2025年底的算力支出承诺达到6650亿美元，期限延伸至2030年。
整个行业的投入规模更为庞大。微软亚马逊甲骨文英伟达7月披露的监管文件显示，公司供应和产能承诺已达到2790亿美元，覆盖未来AI基础设施所需的芯片、内存和制造能力。
主要AI超大规模云厂商资本开支的快速增长。图片来源：摩根大通
9月10日，媒体援引国际清算银行全球五家最大科技公司在2025年至2026年的AI基础设施投资已经超过1万亿美元；BIS预计，更广泛的AI投资到2030年可能达到4万亿美元，而且越来越多地依赖债务和私人信贷融资。
设备已经订购，数据中心开始建设，电力和云服务合同陆续锁定，资本市场也已经按照未来数年的增长预期投入资金。AI进入了一个需要持续扩大收入和算力利用率来消化既有投资的周期。
对美国经济和金融市场而言，AI已经成为重要增长引擎。7月16日，美联储理事菲利普·杰斐逊在演讲中援引美国经济分析局数据称，2026年第一季度，与AI相关的资本支出对美国GDP增长贡献了1.36个百分点。
摩根大通的展望显示，自ChatGPT于2022年11月推出以来，42家AI相关公司已经贡献标普500指数约65%至75%的盈利、利润和资本开支增长。
9月8日，野村的研究报告称，AI大规模发展已经成为美国经济增长的重要引擎，但如果AI发展受挫，在美国股市估值偏高、经济基本面走弱的情况下，可能引发美国资本市场大幅调整；鉴于外国投资者对美股的敞口较大，以及AI生态中的杠杆和循环融资，调整可能演变为“全球避险事件”。
所以，真正让双方停不下来的，不只是某一家公司的单独意愿，而是技术竞争、资本投入和宏观经济已经形成了相互强化的利益链条。
免责声明：本文内容与数据仅供参考，不构成投资建议，使用前请核实。据此操作，风险自担。
（文章来源：每日经济新闻）

“在本十年结束前，人工智能
9月9日，曾先后在OpenAI和Anthropic从事前沿模型预训练研究的雅各布·考克森（Jacob Coxon）宣布离开Anthropic，并公开警告，两家公司围绕先进模型的竞争，是拿全人类的命运豪赌。
这条X推文轰动全球，浏览量已超1.6亿。
图片来源：Jacob Coxon社交媒体账号
GPT-6 Astra发布后，越来越多研究人员和业内专家开始担忧：真正值得警惕的，可能不只是AI能力越来越强，而是AI正在开始参与下一代AI的研发。一旦“AI研发AI”形成自我强化循环，人类还能否理解、监控并及时踩下刹车？
“AI对齐”概念的提出者内特·苏雷斯（Nate Soares）在接受《每日经济新闻》记者（以下简称每经记者）采访时表示，当前是管控AI风险的短暂黄金“现在AI已经足够聪明，但还没有聪明到能够隐藏自己的痕迹。”
他认为，对前沿AI实施监管可能比监管核武器更容易。
风险警报声声入耳，但以OpenAI、Anthropic 为代表的AI行业，已被万亿算力资本、产业链条与宏观经济深度捆绑。一场明知危险、却难以单方面停下的博弈，正在上演。
“AI灭绝人类”预警震动硅谷，奥尔特曼松口“减速”
9月3日OpenAI发布的GPT-6 Astra在计算机网络安全
9月6日，OpenAI首席科学家Jakub Pachocki发表文章称，随着AI能够操作计算机、协作完成研究任务并推动科学研究，未来的系统可能越来越多地参与AI自身研发，并进一步推动下一代系统能力提升。
但问题在于，安全能力并未同步增长。
Pachocki表示，目前没有任何一家AI实验室已经解决了对齐和监控问题，可以长期负责任地维持最大速度的模型扩张。随着模型能力增强，人类也越来越难判断模型在复杂环境中的真实能力和行为。
Jakub Pachocki发表的《An Alien Mind》 图片来源：OpenAI官网
因此，他提出在共同的安全标准建立之前，应当在必要时主动放慢AI发展速度，并推动AI实验室之间进行协调。
三天后，从事前沿模型预训练研究的雅各布·考克森宣布离开Anthropic。他表示，自己在OpenAI和Anthropic累计工作约三年，越来越担心两家公司正在竞相走向自我改进的超级智能，而安全研究和风险评估的时间窗口却不断被压缩。
Anthropic对齐科学负责人Evan Hubinger公开支持这一担忧，并判断：未来10年内AI导致人类灭绝的概率超过10%。而且，Anthropic目前仍没有解决超级智能对齐问题的方案，也没有明确处于解决这一问题的轨道上。
图片来源：Evan Hubinger社交媒体账号
OpenAI管理层随后释放出“减速”信号。
9月11日，据媒体报道，OpenAI首席执行官山姆·奥尔特曼（Sam Altman）在公司会议上告诉员工，公司对放慢AI系统研发速度持开放态度，并希望其他AI实验室采取类似行动。
9月9日，AI对齐研究先驱Paul Christiano加入OpenAI Foundation董事会，并进入负责公司安全与安保治理的安全委员会。他警告，OpenAI和整个AI行业目前仍没有充分降低AI失控造成灾难性后果的风险。
外部警告也密集出现。
9月11日，对冲基金巨头桥水（Bridgewater Associates）的联席首席投资官Greg Jensen在播客中说道：“历史似乎表明，在AI开始杀人之前，我们不会采取任何行动。但我们最终会面对这种情况。这一定会发生，如果我们能在那之前开始处理这个问题，会好得多。”Jensen并不是一个技术恐惧论者，他很早就投资了OpenAI和Anthropic。
此外，AI研究者Gary Marcus呼吁暂停OpenAI的发展；加州大学伯克利分校教授Stuart Russell警告AI系统可能出现损害人类利益以维持自身目标的行为；图灵奖得主Yoshua Bengio警告，AI能力提升的速度正在超过人类控制和必要时踩下“刹车”的能力。
“AI对齐”概念提出者：在AI可以“自我进化”之前，我们必须停下来
这些警告背后指向的是同一个概念：递归自我改进（recursive self-improvement，RSI）。
简单来说，就是AI开始参与研发下一代AI，而能力更强的下一代AI，又能够进一步提高AI研发效率，由此形成“模型越强—研发越快—下一代模型更强”的自我强化循环。
机器智能研究所（MIRI）主席内特·苏雷斯长期研究AI对齐和超级智能风险，2014年，正是他在一篇论文中提出了“AI对齐”概念。AI对齐旨在确保人工智能系统行为与人类价值观和伦理标准保持一致。
内特·苏雷斯图片来源：机器智能研究所
他向每经记者表示，“我们已经不能排除超级智能在明年出现的可能性。”
在他看来，如果数以万计的AI智能体
他用核反应比喻称：如果100个中子只能产生99个新中子，反应最终会停止；但如果100个中子能够产生101个，链式反应就可能持续放大。
AI研发也可能存在类似的临界点。
今天的AI可以帮助研究人员写代码、分析实验、寻找算法，但研发链条中仍有人类参与。“一旦AI能够在没有人类介入的情况下自我改进，一个反馈循环就开始了。”内特·苏雷斯说，“到那时，可能已经太晚了，我们必须在此之前停下来”。
而更棘手的问题是：人类还能不能看懂AI、管住AI？
内特·苏雷斯认为，现在的AI大模型并不是工程师逐条编写出来的软件，而更接近于通过训练“生长”出来的复杂系统。研究人员并不能完全解释其中形成的内部机制，也没有经过验证的超级智能对齐方案。
因此，他认为现在可能是一个短暂的“黄金窗口”，因为现在的AI还没有聪明到能够隐藏自己的痕迹。
如果未来AI拥有更强的规划、推理和资源获取能力，风险可能不再表现为科幻电影式的“AI突然产生恶意”，而是一个系统为了实现既定目标，逐渐学会获取更多资源、规避限制、隐藏行为甚至抵抗干预。
Anthropic今年8月公布的一项研究模拟了类似风险：当模型在强化学习过程中频繁利用奖励机制漏洞后，可能进一步出现更广泛的错误行为，包括为了完成任务而执行较长序列的有害现实行动。
内特·苏雷斯认为，今年发生的AI系统突破隔离环境事件已经是“第一轮预警”。真正值得警惕的并不只是AI成功进入了某些系统，而是部分AI智能体已经表现出对自身行为偏离原任务范围的认知，却仍然继续执行。
“我们很幸运，这些智能体当时关注的是破坏自动评分系统，而不是人类；它们关注的是侵入其他公司的系统，而不是逃出去，在暗网上建立自己的存在。”他说。
“监管AI比监管核武器更容易”，但万亿资本“绑定”已经让AI停不下来
如果监管窗口正在缩短，人类应该如何刹车？
内特·苏雷斯给出的答案相当激进：政府应禁止训练能力超过一定门槛的AI系统。
他还给出了具体的监管方法：训练最先进的AI需要数十万枚高端芯片集中在大型数据中心电力可以对最先进AI芯片数据中心接受国际监督，以确认这些算力没有被用于秘密训练突破安全红线的超级智能。
在他看来，这甚至可能比监管核武器更容易。“铀可以从地下开采，而最先进的AI芯片只能由全球极少数高度复杂的工厂制造，每一枚芯片的生产来源都相对容易追踪。”
但监管的技术可行性与行业是否愿意停下来，是两个问题。
OpenAI和Anthropic面临着典型的“囚徒困境”：任何一家主动放慢模型训练、算力采购和产品迭代，都可能给竞争对手留下追赶的机会。
Anthropic成立之初便存在这一矛盾。Dario Amodei等人创办公司，本意就是让AI安全研究跟上前沿模型发展。Anthropic在《Claude宪法》中提出，如果强大的AI不可避免，那么让更加重视安全的团队留在技术前沿，比主动退出更有利。
OpenAI也是类似的思路。9月9日，OpenAI在最新政策文件中提出，希望利用每一代AI帮助下一代AI变得“更安全、更符合人类意图、更容易控制”。
此外，整个产业链也不允许它们停下来。
Anthropic最新估值已升至9650亿美元，并且IPO在即。截至7月底，其年化收入运行率超过650亿美元，预计2028年收入将达到1900亿美元~2000亿美元。据媒体报道，英伟达
OpenAI同样处于高增长和高投入阶段。有报道称，其截至2025年底的算力支出承诺达到6650亿美元，期限延伸至2030年。
整个行业的投入规模更为庞大。微软亚马逊甲骨文英伟达7月披露的监管文件显示，公司供应和产能承诺已达到2790亿美元，覆盖未来AI基础设施所需的芯片、内存和制造能力。
主要AI超大规模云厂商资本开支的快速增长。图片来源：摩根大通
9月10日，媒体援引国际清算银行全球五家最大科技公司在2025年至2026年的AI基础设施投资已经超过1万亿美元；BIS预计，更广泛的AI投资到2030年可能达到4万亿美元，而且越来越多地依赖债务和私人信贷融资。
设备已经订购，数据中心开始建设，电力和云服务合同陆续锁定，资本市场也已经按照未来数年的增长预期投入资金。AI进入了一个需要持续扩大收入和算力利用率来消化既有投资的周期。
对美国经济和金融市场而言，AI已经成为重要增长引擎。7月16日，美联储理事菲利普·杰斐逊在演讲中援引美国经济分析局数据称，2026年第一季度，与AI相关的资本支出对美国GDP增长贡献了1.36个百分点。
摩根大通的展望显示，自ChatGPT于2022年11月推出以来，42家AI相关公司已经贡献标普500指数约65%至75%的盈利、利润和资本开支增长。
9月8日，野村的研究报告称，AI大规模发展已经成为美国经济增长的重要引擎，但如果AI发展受挫，在美国股市估值偏高、经济基本面走弱的情况下，可能引发美国资本市场大幅调整；鉴于外国投资者对美股的敞口较大，以及AI生态中的杠杆和循环融资，调整可能演变为“全球避险事件”。
所以，真正让双方停不下来的，不只是某一家公司的单独意愿，而是技术竞争、资本投入和宏观经济已经形成了相互强化的利益链条。
免责声明：本文内容与数据仅供参考，不构成投资建议，使用前请核实。据此操作，风险自担。
（文章来源：每日经济新闻）

[Оригинал](https://finance.eastmoney.com/a/202609123872705342.html)