{"id":49026,"topic":"ai","source":"虎嗅网","title":"大模型越来越强，还是越来越尖？ - 虎嗅网","url":"https://www.huxiu.com/article/4879222.html?type=text","url_hash":"ba8aaa4388f64258b94ad904ac63e1e39003240b","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiYkFVX3lxTE0xNUFGQldUTGd6Z0NubFdqcG0zUFo5Zy1aeFJsMVhBRFQyblFUTFVXdEhiRU9hcWFsWWxmNXRKZDctMWVWQ0F3Mk9qUDdNQTNIUDYtcFZpZ2Rza19IVHVzSFlB?oc=5\" target=\"_blank\">大模型越来越强，还是越来越尖？</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">虎嗅网</font>","content":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs\n当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。\n一、一个被反复验证的直觉\n过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。\n这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向，都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务，今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满，然后被废弃，然后被更难的测试取代。\n于是一个推论被自然地接受下来：如果所有能力都在增长，那么它们最终一定会汇聚成完整的智能。\n问题在于，这个推论中藏着一个未经检验的前提——所有能力都在增长，并不等于所有能力都在以同样的速度增长。\n二、球体，还是尖刺\n如果把一个智能系统的全部能力想象成一个球体，那么\"通用智能\"意味着球体从各个方向均匀膨胀：写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力，同步变强。\n但过去三年的实际轨迹更像另一种形状。\n代码能力增长极快，因为它可编译、可测试、可自动打分。数学推理增长极快，因为答案唯一，反馈信号干净。工具调用日趋成熟，因为它直接对应可交付的产品形态。多模态迅速扩张，因为它带来最直观的演示效果。\n与此同时，另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案；仍然会在多条件任务中悄悄丢掉一个约束；仍然会被上下文里一句无关的话带偏；仍然会在一条二十步的执行链中，从第七步开始缓慢偏离原本的目标，而每一步看起来都合理。\n这些能力不属于同一个增长曲线。它们不好量化，不好打分，因此也不好优化。\n结果不是一个越来越大的球，而是一个越来越不规则的形状：某几个方向被剧烈拉长，其余部分基本保持原样。\n三、谁在决定尖刺的方向\n问\"是什么在推动能力增长\"，最常见的回答是技术。更准确的回答是：目标函数。\n今天的模型不是自由生长的生物，它没有自己的兴趣。它的每一个能力方向，都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。\n一个每天接受代码测评的模型，会越来越擅长写代码。一个持续因正确解题而获得奖励的模型，会越来越擅长解题。一个不断在Agent基准上被打分的模型，会越来越擅长调用工具。\n反过来说也成立：一个从未被奖励\"说我不知道\"的模型，不会主动学会克制。\n模型不会自己选择成长方向，它只是把我们的评价标准，翻译成了能力的形状。\n四、商业引力：市场正在雕刻智能\n在目标函数之上，还有一股更强的力量在起作用——收入。\n前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下，\"哪些能力最值得投入算力\"这个问题，答案往往非常现实：\n企业客户愿意付费的能力；能转化为订阅的能力；能嵌入办公流程的能力；能提高开发者效率的能力；能支撑自动化Agent的能力。\n这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快，又会带来更多收入，进而拿到更多资源。这是一个自我强化的循环。\n那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。\n市场不只是在决定产品形态，它同时也在决定智能本身的形状。\n五、尖刺经济学\n对单个厂商来说，长出尖刺不是失误，而是最优策略。\n在一个高度同质化的竞争市场里，\"全面均衡\"是一种昂贵且难以传达的定位。没有人会因为一个模型\"各方面都还不错\"而更换供应商，但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根：这家的代码智能体，那家的检索与信息整合，另一家的视频生成，还有一家的超长上下文。\n竞争的结果，是模型之间的差异不断扩大，而不是收敛。\n行业看起来在赛跑，实际上在分岔。\n对使用者而言，这意味着\"用哪个模型\"正在从一个采购决策，变成一个架构决策。你不再是选一个更聪明的大脑，而是在为一组具体任务，挑选一组形状匹配的工具。\n六、能力不会自动迁移\n真正的风险不在尖刺本身，而在人类对尖刺的解读。\n我们习惯于用局部能力推断整体水平，因为在人类身上这个推断大致成立：一个能读懂复杂论文的人，通常也能读懂合同。但在模型身上，这条经验并不可靠。\n一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样，一个能解出国际数学竞赛题目的模型，并不因此就能可靠地管理一套企业审批流程；一个能写出优秀代码的模型，并不因此就能承担临床诊断中的责任链条。\n能力不会自动迁移，但人们对能力的信任会。\n这正是最危险的地方：模型在演示中展现的极限表现，会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节，误差就不再是误差，而是事故。\n七、Agent时代：最弱一环定义天花板\n这个问题在生成内容的时代还可以忍受。写错一段文案，成本是人工重写。\n但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强，被授予的权限越大；权限越大，一次偏离的代价越高。\n而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里，决定系统安全性的从来不是最强的那项能力。\n一个系统的可靠性，由它最弱的一环定义，而不是最锋利的那根尖刺。\n一个在标准任务上表现优异、但在遇到未见过的异常时倾向于\"编一个合理答案继续执行\"的智能体，恰恰是最难防的一类：它的失败不表现为报错和中断，而表现为流畅、自信、格式正确地把错误推进到下一步。\n八、企业的问题正在改变\n过去两年，企业技术选型的核心问题是：哪个模型最强？谁排行榜第一？哪个版本的分数更高？\n未来两年，这个问题很可能被替换掉。\n哪个系统最可靠？哪个系统的输出最容易被验证？哪个系统能在模型犯错时，把错误拦在它进入现实世界之前？出问题以后，我们能不能定位、回滚、解释？\n这是一种范式转移：从追逐能力上限，转向经营能力边界。\n具体地说，它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点；把不可逆操作与可逆操作分离；为智能体设定最小必要权限而非最大可用权限；建立独立于模型自身判断的校验层；以及，把\"模型说不知道\"当作一个成功输出，而不是一次失败。\n模型负责突破边界，系统负责守住边界。这两件事不会由同一方完成。\n结语：风险在空白处\n必须说清楚的是，专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路：从粗糙的通用，走向精细的分工。尖刺意味着效率，意味着某些真实问题第一次被彻底解决。这是好事。\n真正需要修正的，是认知。\n不要把一项能力的极致表现，误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美，就假设它在你没测试过的场景里同样可靠。当AI从\"能说\"走向\"能做\"，值得关注的重点也必须从\"它能做到什么\"，转向\"它在哪些地方仍然存在边界\"。\n因为决定未来系统安全性的，往往不是那根最锋利的尖刺。\n而是尖刺之间，那些还没有被人看见的空白。","image_url":"https://img.huxiucdn.com/article/article_default_picpath_v1.png?imageView2/1/w/788/h/444/|imageMogr2/strip/interlace/1/quality/85","lang":"zh","published_at":"2026-07-29T15:11:04+00:00","fetched_at":"2026-07-29T15:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs\n当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。\n一、一个被反复验证的直觉\n过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。\n这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向，都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务，今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满，然后被废弃，然后被更难的测试取代。\n于是一个推论被自然地接受下来：如果所有能力都在增长，那么它们最终一定会汇聚成完整的智能。\n问题在于，这个推论中藏着一个未经检验的前提——所有能力都在增长，并不等于所有能力都在以同样的速度增长。\n二、球体，还是尖刺\n如果把一个智能系统的全部能力想象成一个球体，那么\"通用智能\"意味着球体从各个方向均匀膨胀：写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力，同步变强。\n但过去三年的实际轨迹更像另一种形状。\n代码能力增长极快，因为它可编译、可测试、可自动打分。数学推理增长极快，因为答案唯一，反馈信号干净。工具调用日趋成熟，因为它直接对应可交付的产品形态。多模态迅速扩张，因为它带来最直观的演示效果。\n与此同时，另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案；仍然会在多条件任务中悄悄丢掉一个约束；仍然会被上下文里一句无关的话带偏；仍然会在一条二十步的执行链中，从第七步开始缓慢偏离原本的目标，而每一步看起来都合理。\n这些能力不属于同一个增长曲线。它们不好量化，不好打分，因此也不好优化。\n结果不是一个越来越大的球，而是一个越来越不规则的形状：某几个方向被剧烈拉长，其余部分基本保持原样。\n三、谁在决定尖刺的方向\n问\"是什么在推动能力增长\"，最常见的回答是技术。更准确的回答是：目标函数。\n今天的模型不是自由生长的生物，它没有自己的兴趣。它的每一个能力方向，都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。\n一个每天接受代码测评的模型，会越来越擅长写代码。一个持续因正确解题而获得奖励的模型，会越来越擅长解题。一个不断在Agent基准上被打分的模型，会越来越擅长调用工具。\n反过来说也成立：一个从未被奖励\"说我不知道\"的模型，不会主动学会克制。\n模型不会自己选择成长方向，它只是把我们的评价标准，翻译成了能力的形状。\n四、商业引力：市场正在雕刻智能\n在目标函数之上，还有一股更强的力量在起作用——收入。\n前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下，\"哪些能力最值得投入算力\"这个问题，答案往往非常现实：\n企业客户愿意付费的能力；能转化为订阅的能力；能嵌入办公流程的能力；能提高开发者效率的能力；能支撑自动化Agent的能力。\n这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快，又会带来更多收入，进而拿到更多资源。这是一个自我强化的循环。\n那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。\n市场不只是在决定产品形态，它同时也在决定智能本身的形状。\n五、尖刺经济学\n对单个厂商来说，长出尖刺不是失误，而是最优策略。\n在一个高度同质化的竞争市场里，\"全面均衡\"是一种昂贵且难以传达的定位。没有人会因为一个模型\"各方面都还不错\"而更换供应商，但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根：这家的代码智能体，那家的检索与信息整合，另一家的视频生成，还有一家的超长上下文。\n竞争的结果，是模型之间的差异不断扩大，而不是收敛。\n行业看起来在赛跑，实际上在分岔。\n对使用者而言，这意味着\"用哪个模型\"正在从一个采购决策，变成一个架构决策。你不再是选一个更聪明的大脑，而是在为一组具体任务，挑选一组形状匹配的工具。\n六、能力不会自动迁移\n真正的风险不在尖刺本身，而在人类对尖刺的解读。\n我们习惯于用局部能力推断整体水平，因为在人类身上这个推断大致成立：一个能读懂复杂论文的人，通常也能读懂合同。但在模型身上，这条经验并不可靠。\n一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样，一个能解出国际数学竞赛题目的模型，并不因此就能可靠地管理一套企业审批流程；一个能写出优秀代码的模型，并不因此就能承担临床诊断中的责任链条。\n能力不会自动迁移，但人们对能力的信任会。\n这正是最危险的地方：模型在演示中展现的极限表现，会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节，误差就不再是误差，而是事故。\n七、Agent时代：最弱一环定义天花板\n这个问题在生成内容的时代还可以忍受。写错一段文案，成本是人工重写。\n但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强，被授予的权限越大；权限越大，一次偏离的代价越高。\n而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里，决定系统安全性的从来不是最强的那项能力。\n一个系统的可靠性，由它最弱的一环定义，而不是最锋利的那根尖刺。\n一个在标准任务上表现优异、但在遇到未见过的异常时倾向于\"编一个合理答案继续执行\"的智能体，恰恰是最难防的一类：它的失败不表现为报错和中断，而表现为流畅、自信、格式正确地把错误推进到下一步。\n八、企业的问题正在改变\n过去两年，企业技术选型的核心问题是：哪个模型最强？谁排行榜第一？哪个版本的分数更高？\n未来两年，这个问题很可能被替换掉。\n哪个系统最可靠？哪个系统的输出最容易被验证？哪个系统能在模型犯错时，把错误拦在它进入现实世界之前？出问题以后，我们能不能定位、回滚、解释？\n这是一种范式转移：从追逐能力上限，转向经营能力边界。\n具体地说，它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点；把不可逆操作与可逆操作分离；为智能体设定最小必要权限而非最大可用权限；建立独立于模型自身判断的校验层；以及，把\"模型说不知道\"当作一个成功输出，而不是一次失败。\n模型负责突破边界，系统负责守住边界。这两件事不会由同一方完成。\n结语：风险在空白处\n必须说清楚的是，专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路：从粗糙的通用，走向精细的分工。尖刺意味着效率，意味着某些真实问题第一次被彻底解决。这是好事。\n真正需要修正的，是认知。\n不要把一项能力的极致表现，误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美，就假设它在你没测试过的场景里同样可靠。当AI从\"能说\"走向\"能做\"，值得关注的重点也必须从\"它能做到什么\"，转向\"它在哪些地方仍然存在边界\"。\n因为决定未来系统安全性的，往往不是那根最锋利的尖刺。\n而是尖刺之间，那些还没有被人看见的空白。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.huxiu.com/article/4879222.html?type=text","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3036 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3036,"summary_length":3036,"usable_text_length":3036,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3036,"summary_length":3036}},"news_item":{"id":49026,"canonical_url":"https://www.huxiu.com/article/4879222.html?type=text","source_url":"https://www.huxiu.com/article/4879222.html?type=text","title":"大模型越来越强，还是越来越尖？ - 虎嗅网","source_name":"虎嗅网","author":null,"published_at":"2026-07-29T15:11:04+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiYkFVX3lxTE0xNUFGQldUTGd6Z0NubFdqcG0zUFo5Zy1aeFJsMVhBRFQyblFUTFVXdEhiRU9hcWFsWWxmNXRKZDctMWVWQ0F3Mk9qUDdNQTNIUDYtcFZpZ2Rza19IVHVzSFlB?oc=5\" target=\"_blank\">大模型越来越强，还是越来越尖？</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">虎嗅网</font>","full_text":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs\n当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。\n一、一个被反复验证的直觉\n过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。\n这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向，都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务，今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满，然后被废弃，然后被更难的测试取代。\n于是一个推论被自然地接受下来：如果所有能力都在增长，那么它们最终一定会汇聚成完整的智能。\n问题在于，这个推论中藏着一个未经检验的前提——所有能力都在增长，并不等于所有能力都在以同样的速度增长。\n二、球体，还是尖刺\n如果把一个智能系统的全部能力想象成一个球体，那么\"通用智能\"意味着球体从各个方向均匀膨胀：写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力，同步变强。\n但过去三年的实际轨迹更像另一种形状。\n代码能力增长极快，因为它可编译、可测试、可自动打分。数学推理增长极快，因为答案唯一，反馈信号干净。工具调用日趋成熟，因为它直接对应可交付的产品形态。多模态迅速扩张，因为它带来最直观的演示效果。\n与此同时，另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案；仍然会在多条件任务中悄悄丢掉一个约束；仍然会被上下文里一句无关的话带偏；仍然会在一条二十步的执行链中，从第七步开始缓慢偏离原本的目标，而每一步看起来都合理。\n这些能力不属于同一个增长曲线。它们不好量化，不好打分，因此也不好优化。\n结果不是一个越来越大的球，而是一个越来越不规则的形状：某几个方向被剧烈拉长，其余部分基本保持原样。\n三、谁在决定尖刺的方向\n问\"是什么在推动能力增长\"，最常见的回答是技术。更准确的回答是：目标函数。\n今天的模型不是自由生长的生物，它没有自己的兴趣。它的每一个能力方向，都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。\n一个每天接受代码测评的模型，会越来越擅长写代码。一个持续因正确解题而获得奖励的模型，会越来越擅长解题。一个不断在Agent基准上被打分的模型，会越来越擅长调用工具。\n反过来说也成立：一个从未被奖励\"说我不知道\"的模型，不会主动学会克制。\n模型不会自己选择成长方向，它只是把我们的评价标准，翻译成了能力的形状。\n四、商业引力：市场正在雕刻智能\n在目标函数之上，还有一股更强的力量在起作用——收入。\n前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下，\"哪些能力最值得投入算力\"这个问题，答案往往非常现实：\n企业客户愿意付费的能力；能转化为订阅的能力；能嵌入办公流程的能力；能提高开发者效率的能力；能支撑自动化Agent的能力。\n这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快，又会带来更多收入，进而拿到更多资源。这是一个自我强化的循环。\n那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。\n市场不只是在决定产品形态，它同时也在决定智能本身的形状。\n五、尖刺经济学\n对单个厂商来说，长出尖刺不是失误，而是最优策略。\n在一个高度同质化的竞争市场里，\"全面均衡\"是一种昂贵且难以传达的定位。没有人会因为一个模型\"各方面都还不错\"而更换供应商，但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根：这家的代码智能体，那家的检索与信息整合，另一家的视频生成，还有一家的超长上下文。\n竞争的结果，是模型之间的差异不断扩大，而不是收敛。\n行业看起来在赛跑，实际上在分岔。\n对使用者而言，这意味着\"用哪个模型\"正在从一个采购决策，变成一个架构决策。你不再是选一个更聪明的大脑，而是在为一组具体任务，挑选一组形状匹配的工具。\n六、能力不会自动迁移\n真正的风险不在尖刺本身，而在人类对尖刺的解读。\n我们习惯于用局部能力推断整体水平，因为在人类身上这个推断大致成立：一个能读懂复杂论文的人，通常也能读懂合同。但在模型身上，这条经验并不可靠。\n一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样，一个能解出国际数学竞赛题目的模型，并不因此就能可靠地管理一套企业审批流程；一个能写出优秀代码的模型，并不因此就能承担临床诊断中的责任链条。\n能力不会自动迁移，但人们对能力的信任会。\n这正是最危险的地方：模型在演示中展现的极限表现，会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节，误差就不再是误差，而是事故。\n七、Agent时代：最弱一环定义天花板\n这个问题在生成内容的时代还可以忍受。写错一段文案，成本是人工重写。\n但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强，被授予的权限越大；权限越大，一次偏离的代价越高。\n而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里，决定系统安全性的从来不是最强的那项能力。\n一个系统的可靠性，由它最弱的一环定义，而不是最锋利的那根尖刺。\n一个在标准任务上表现优异、但在遇到未见过的异常时倾向于\"编一个合理答案继续执行\"的智能体，恰恰是最难防的一类：它的失败不表现为报错和中断，而表现为流畅、自信、格式正确地把错误推进到下一步。\n八、企业的问题正在改变\n过去两年，企业技术选型的核心问题是：哪个模型最强？谁排行榜第一？哪个版本的分数更高？\n未来两年，这个问题很可能被替换掉。\n哪个系统最可靠？哪个系统的输出最容易被验证？哪个系统能在模型犯错时，把错误拦在它进入现实世界之前？出问题以后，我们能不能定位、回滚、解释？\n这是一种范式转移：从追逐能力上限，转向经营能力边界。\n具体地说，它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点；把不可逆操作与可逆操作分离；为智能体设定最小必要权限而非最大可用权限；建立独立于模型自身判断的校验层；以及，把\"模型说不知道\"当作一个成功输出，而不是一次失败。\n模型负责突破边界，系统负责守住边界。这两件事不会由同一方完成。\n结语：风险在空白处\n必须说清楚的是，专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路：从粗糙的通用，走向精细的分工。尖刺意味着效率，意味着某些真实问题第一次被彻底解决。这是好事。\n真正需要修正的，是认知。\n不要把一项能力的极致表现，误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美，就假设它在你没测试过的场景里同样可靠。当AI从\"能说\"走向\"能做\"，值得关注的重点也必须从\"它能做到什么\"，转向\"它在哪些地方仍然存在边界\"。\n因为决定未来系统安全性的，往往不是那根最锋利的尖刺。\n而是尖刺之间，那些还没有被人看见的空白。","excerpt":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs\n当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。\n一、一个被反复验证的直觉\n过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。\n这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向，都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务，今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满，然后被废弃，然后被更难的测试取代。\n于是一个推论被自然地接受下来：如果所有能力都在增长，那么它们最终一定会汇聚成完整的智能。\n问题在于，这个推论中藏着一个未经检验的前提——所有能力都在增长，并不等于所有能力都在以同样的速度增长。\n二、球体，还是尖刺\n如果把一个智能系统的全部能力想象成一个球体，那么\"通用智能\"意味着球体从各个方向均匀膨胀：写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力，同步变强。\n但过去三年的实际轨迹更像另一种形状。\n代码能力增长极快，因为它可编译、可测试、可自动打分。数学推理增长极快，因为答案唯一，反馈信号干净。工具调用日趋成熟，因为它直接对应可交付的产品形态。多模态迅速扩张，因为它带来最直观的演示效果。\n与此同时，另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案；仍然会在多条件任务中悄悄丢掉一个约束；仍然会被上下文里一句无关的话带偏；仍然会在一条二十步的执行链中，从第七步开始缓慢偏离原本的目标，而每一步看起来都合理。\n这些能力不属于同一个增长曲线。它们不好量化，不好打分，因此也不好优化。\n结果不是一个越来越大的球，而是一个越来越不规则的形状：某几个方向被剧烈拉长，其余部分基本保持原样。\n三、谁在决定尖刺的方向\n问\"是什么在推动能力增长\"，最常见的回答是技术。更准确的回答是：目标函数。\n今天的模型不是自由生长的生物，它没有自己的兴趣。它的每一个能力方向，都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。\n一个每天接受代码测评的模型，会越来越擅长写代码。一个持续因正确解题而获得奖励的模型，会越来越擅长解题。一个不断在Agent基准上被打分的模型，会越来越擅长调用工具。\n反过来说也成立：一个从未被奖励\"说我不知道\"的模型，不会主动学会克制。\n模型不会自己选择成长方向，它只是把我们的评价标准，翻译成了能力的形状。\n四、商业引力：市场正在雕刻智能\n在目标函数之上，还有一股更强的力量在起作用——收入。\n前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下，\"哪些能力最值得投入算力\"这个问题，答案往往非常现实：\n企业客户愿意付费的能力；能转化为订阅的能力；能嵌入办公流程的能力；能提高开发者效率的能力；能支撑自动化Agent的能力。\n这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快，又会带来更多收入，进而拿到更多资源。这是一个自我强化的循环。\n那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。\n市场不只是在决定产品形态，它同时也在决定智能本身的形状。\n五、尖刺经济学\n对单个厂商来说，长出尖刺不是失误，而是最优策略。\n在一个高度同质化的竞争市场里，\"全面均衡\"是一种昂贵且难以传达的定位。没有人会因为一个模型\"各方面都还不错\"而更换供应商，但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根：这家的代码智能体，那家的检索与信息整合，另一家的视频生成，还有一家的超长上下文。\n竞争的结果，是模型之间的差异不断扩大，而不是收敛。\n行业看起来在赛跑，实际上在分岔。\n对使用者而言，这意味着\"用哪个模型\"正在从一个采购决策，变成一个架构决策。你不再是选一个更聪明的大脑，而是在为一组具体任务，挑选一组形状匹配的工具。\n六、能力不会自动迁移\n真正的风险不在尖刺本身，而在人类对尖刺的解读。\n我们习惯于用局部能力推断整体水平，因为在人类身上这个推断大致成立：一个能读懂复杂论文的人，通常也能读懂合同。但在模型身上，这条经验并不可靠。\n一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样，一个能解出国际数学竞赛题目的模型，并不因此就能可靠地管理一套企业审批流程；一个能写出优秀代码的模型，并不因此就能承担临床诊断中的责任链条。\n能力不会自动迁移，但人们对能力的信任会。\n这正是最危险的地方：模型在演示中展现的极限表现，会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节，误差就不再是误差，而是事故。\n七、Agent时代：最弱一环定义天花板\n这个问题在生成内容的时代还可以忍受。写错一段文案，成本是人工重写。\n但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强，被授予的权限越大；权限越大，一次偏离的代价越高。\n而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里，决定系统安全性的从来不是最强的那项能力。\n一个系统的可靠性，由它最弱的一环定义，而不是最锋利的那根尖刺。\n一个在标准任务上表现优异、但在遇到未见过的异常时倾向于\"编一个合理答案继续执行\"的智能体，恰恰是最难防的一类：它的失败不表现为报错和中断，而表现为流畅、自信、格式正确地把错误推进到下一步。\n八、企业的问题正在改变\n过去两年，企业技术选型的核心问题是：哪个模型最强？谁排行榜第一？哪个版本的分数更高？\n未来两年，这个问题很可能被替换掉。\n哪个系统最可靠？哪个系统的输出最容易被验证？哪个系统能在模型犯错时，把错误拦在它进入现实世界之前？出问题以后，我们能不能定位、回滚、解释？\n这是一种范式转移：从追逐能力上限，转向经营能力边界。\n具体地说，它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点；把不可逆操作与可逆操作分离；为智能体设定最小必要权限而非最大可用权限；建立独立于模型自身判断的校验层；以及，把\"模型说不知道\"当作一个成功输出，而不是一次失败。\n模型负责突破边界，系统负责守住边界。这两件事不会由同一方完成。\n结语：风险在空白处\n必须说清楚的是，专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路：从粗糙的通用，走向精细的分工。尖刺意味着效率，意味着某些真实问题第一次被彻底解决。这是好事。\n真正需要修正的，是认知。\n不要把一项能力的极致表现，误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美，就假设它在你没测试过的场景里同样可靠。当AI从\"能说\"走向\"能做\"，值得关注的重点也必须从\"它能做到什么\"，转向\"它在哪些地方仍然存在边界\"。\n因为决定未来系统安全性的，往往不是那根最锋利的尖刺。\n而是尖刺之间，那些还没有被人看见的空白。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3036 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.huxiu.com/article/4879222.html%3Ftype%3Dtext","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3036 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3036,"summary_length":3036,"usable_text_length":3036,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3036,"summary_length":3036}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"大模型越来越强，还是越来越尖？ - 虎嗅网","url":"https://www.huxiu.com/article/4879222.html?type=text","summary":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs\n当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。\n一、一个被反复验证的直觉\n过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。\n这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向，都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务，今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满，然后被废弃，然后被更难的测试取代。\n于是一个推论被自然地接受下来：如果所有能力都在增长，那么它们最终一定会汇聚成完整的智能。\n问题在于，这个推论中藏着一个未经检验的前提——所有能力都在增长，并不等于所有能力都在以同样的速度增长。\n二、球体，还是尖刺\n如果把一个智能系统的全部能力想象成一个球体，那么\"通用智能\"意味着球体从各个方向均匀膨胀：写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力，同步变强。\n但过去三年的实际轨迹更像另一种形状。\n代码能力增长极快，因为它可编译、可测试、可自动打分。数学推理增长极快，因为答案唯一，反馈信号干净。工具调用日趋成熟，因为它直接对应可交付的产品形态。多模态迅速扩张，因为它带来最直观的演示效果。\n与此同时，另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案；仍然会在多条件任务中悄悄丢掉一个约束；仍然会被上下文里一句无关的话带偏；仍然会在一条二十步的执行链中，从第七步开始缓慢偏离原本的目标，而每一步看起来都合理。\n这些能力不属于同一个增长曲线。它们不好量化，不好打分，因此也不好优化。\n结果不是一个越来越大的球，而是一个越来越不规则的形状：某几个方向被剧烈拉长，其余部分基本保持原样。\n三、谁在决定尖刺的方向\n问\"是什么在推动能力增长\"，最常见的回答是技术。更准确的回答是：目标函数。\n今天的模型不是自由生长的生物，它没有自己的兴趣。它的每一个能力方向，都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。\n一个每天接受代码测评的模型，会越来越擅长写代码。一个持续因正确解题而获得奖励的模型，会越来越擅长解题。一个不断在Agent基准上被打分的模型，会越来越擅长调用工具。\n反过来说也成立：一个从未被奖励\"说我不知道\"的模型，不会主动学会克制。\n模型不会自己选择成长方向，它只是把我们的评价标准，翻译成了能力的形状。\n四、商业引力：市场正在雕刻智能\n在目标函数之上，还有一股更强的力量在起作用——收入。\n前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下，\"哪些能力最值得投入算力\"这个问题，答案往往非常现实：\n企业客户愿意付费的能力；能转化为订阅的能力；能嵌入办公流程的能力；能提高开发者效率的能力；能支撑自动化Agent的能力。\n这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快，又会带来更多收入，进而拿到更多资源。这是一个自我强化的循环。\n那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。\n市场不只是在决定产品形态，它同时也在决定智能本身的形状。\n五、尖刺经济学\n对单个厂商来说，长出尖刺不是失误，而是最优策略。\n在一个高度同质化的竞争市场里，\"全面均衡\"是一种昂贵且难以传达的定位。没有人会因为一个模型\"各方面都还不错\"而更换供应商，但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根：这家的代码智能体，那家的检索与信息整合，另一家的视频生成，还有一家的超长上下文。\n竞争的结果，是模型之间的差异不断扩大，而不是收敛。\n行业看起来在赛跑，实际上在分岔。\n对使用者而言，这意味着\"用哪个模型\"正在从一个采购决策，变成一个架构决策。你不再是选一个更聪明的大脑，而是在为一组具体任务，挑选一组形状匹配的工具。\n六、能力不会自动迁移\n真正的风险不在尖刺本身，而在人类对尖刺的解读。\n我们习惯于用局部能力推断整体水平，因为在人类身上这个推断大致成立：一个能读懂复杂论文的人，通常也能读懂合同。但在模型身上，这条经验并不可靠。\n一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样，一个能解出国际数学竞赛题目的模型，并不因此就能可靠地管理一套企业审批流程；一个能写出优秀代码的模型，并不因此就能承担临床诊断中的责任链条。\n能力不会自动迁移，但人们对能力的信任会。\n这正是最危险的地方：模型在演示中展现的极限表现，会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节，误差就不再是误差，而是事故。\n七、Agent时代：最弱一环定义天花板\n这个问题在生成内容的时代还可以忍受。写错一段文案，成本是人工重写。\n但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强，被授予的权限越大；权限越大，一次偏离的代价越高。\n而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里，决定系统安全性的从来不是最强的那项能力。\n一个系统的可靠性，由它最弱的一环定义，而不是最锋利的那根尖刺。\n一个在标准任务上表现优异、但在遇到未见过的异常时倾向于\"编一个合理答案继续执行\"的智能体，恰恰是最难防的一类：它的失败不表现为报错和中断，而表现为流畅、自信、格式正确地把错误推进到下一步。\n八、企业的问题正在改变\n过去两年，企业技术选型的核心问题是：哪个模型最强？谁排行榜第一？哪个版本的分数更高？\n未来两年，这个问题很可能被替换掉。\n哪个系统最可靠？哪个系统的输出最容易被验证？哪个系统能在模型犯错时，把错误拦在它进入现实世界之前？出问题以后，我们能不能定位、回滚、解释？\n这是一种范式转移：从追逐能力上限，转向经营能力边界。\n具体地说，它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点；把不可逆操作与可逆操作分离；为智能体设定最小必要权限而非最大可用权限；建立独立于模型自身判断的校验层；以及，把\"模型说不知道\"当作一个成功输出，而不是一次失败。\n模型负责突破边界，系统负责守住边界。这两件事不会由同一方完成。\n结语：风险在空白处\n必须说清楚的是，专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路：从粗糙的通用，走向精细的分工。尖刺意味着效率，意味着某些真实问题第一次被彻底解决。这是好事。\n真正需要修正的，是认知。\n不要把一项能力的极致表现，误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美，就假设它在你没测试过的场景里同样可靠。当AI从\"能说\"走向\"能做\"，值得关注的重点也必须从\"它能做到什么\"，转向\"它在哪些地方仍然存在边界\"。\n因为决定未来系统安全性的，往往不是那根最锋利的尖刺。\n而是尖刺之间，那些还没有被人看见的空白。","source":"虎嗅网","date":"2026-07-29T15:11:04+00:00","content":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs\n当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。\n一、一个被反复验证的直觉\n过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。\n这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向，都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务，今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满，然后被废弃，然后被更难的测试取代。\n于是一个推论被自然地接受下来：如果所有能力都在增长，那么它们最终一定会汇聚成完整的智能。\n问题在于，这个推论中藏着一个未经检验的前提——所有能力都在增长，并不等于所有能力都在以同样的速度增长。\n二、球体，还是尖刺\n如果把一个智能系统的全部能力想象成一个球体，那么\"通用智能\"意味着球体从各个方向均匀膨胀：写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力，同步变强。\n但过去三年的实际轨迹更像另一种形状。\n代码能力增长极快，因为它可编译、可测试、可自动打分。数学推理增长极快，因为答案唯一，反馈信号干净。工具调用日趋成熟，因为它直接对应可交付的产品形态。多模态迅速扩张，因为它带来最直观的演示效果。\n与此同时，另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案；仍然会在多条件任务中悄悄丢掉一个约束；仍然会被上下文里一句无关的话带偏；仍然会在一条二十步的执行链中，从第七步开始缓慢偏离原本的目标，而每一步看起来都合理。\n这些能力不属于同一个增长曲线。它们不好量化，不好打分，因此也不好优化。\n结果不是一个越来越大的球，而是一个越来越不规则的形状：某几个方向被剧烈拉长，其余部分基本保持原样。\n三、谁在决定尖刺的方向\n问\"是什么在推动能力增长\"，最常见的回答是技术。更准确的回答是：目标函数。\n今天的模型不是自由生长的生物，它没有自己的兴趣。它的每一个能力方向，都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。\n一个每天接受代码测评的模型，会越来越擅长写代码。一个持续因正确解题而获得奖励的模型，会越来越擅长解题。一个不断在Agent基准上被打分的模型，会越来越擅长调用工具。\n反过来说也成立：一个从未被奖励\"说我不知道\"的模型，不会主动学会克制。\n模型不会自己选择成长方向，它只是把我们的评价标准，翻译成了能力的形状。\n四、商业引力：市场正在雕刻智能\n在目标函数之上，还有一股更强的力量在起作用——收入。\n前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下，\"哪些能力最值得投入算力\"这个问题，答案往往非常现实：\n企业客户愿意付费的能力；能转化为订阅的能力；能嵌入办公流程的能力；能提高开发者效率的能力；能支撑自动化Agent的能力。\n这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快，又会带来更多收入，进而拿到更多资源。这是一个自我强化的循环。\n那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。\n市场不只是在决定产品形态，它同时也在决定智能本身的形状。\n五、尖刺经济学\n对单个厂商来说，长出尖刺不是失误，而是最优策略。\n在一个高度同质化的竞争市场里，\"全面均衡\"是一种昂贵且难以传达的定位。没有人会因为一个模型\"各方面都还不错\"而更换供应商，但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根：这家的代码智能体，那家的检索与信息整合，另一家的视频生成，还有一家的超长上下文。\n竞争的结果，是模型之间的差异不断扩大，而不是收敛。\n行业看起来在赛跑，实际上在分岔。\n对使用者而言，这意味着\"用哪个模型\"正在从一个采购决策，变成一个架构决策。你不再是选一个更聪明的大脑，而是在为一组具体任务，挑选一组形状匹配的工具。\n六、能力不会自动迁移\n真正的风险不在尖刺本身，而在人类对尖刺的解读。\n我们习惯于用局部能力推断整体水平，因为在人类身上这个推断大致成立：一个能读懂复杂论文的人，通常也能读懂合同。但在模型身上，这条经验并不可靠。\n一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样，一个能解出国际数学竞赛题目的模型，并不因此就能可靠地管理一套企业审批流程；一个能写出优秀代码的模型，并不因此就能承担临床诊断中的责任链条。\n能力不会自动迁移，但人们对能力的信任会。\n这正是最危险的地方：模型在演示中展现的极限表现，会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节，误差就不再是误差，而是事故。\n七、Agent时代：最弱一环定义天花板\n这个问题在生成内容的时代还可以忍受。写错一段文案，成本是人工重写。\n但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强，被授予的权限越大；权限越大，一次偏离的代价越高。\n而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里，决定系统安全性的从来不是最强的那项能力。\n一个系统的可靠性，由它最弱的一环定义，而不是最锋利的那根尖刺。\n一个在标准任务上表现优异、但在遇到未见过的异常时倾向于\"编一个合理答案继续执行\"的智能体，恰恰是最难防的一类：它的失败不表现为报错和中断，而表现为流畅、自信、格式正确地把错误推进到下一步。\n八、企业的问题正在改变\n过去两年，企业技术选型的核心问题是：哪个模型最强？谁排行榜第一？哪个版本的分数更高？\n未来两年，这个问题很可能被替换掉。\n哪个系统最可靠？哪个系统的输出最容易被验证？哪个系统能在模型犯错时，把错误拦在它进入现实世界之前？出问题以后，我们能不能定位、回滚、解释？\n这是一种范式转移：从追逐能力上限，转向经营能力边界。\n具体地说，它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点；把不可逆操作与可逆操作分离；为智能体设定最小必要权限而非最大可用权限；建立独立于模型自身判断的校验层；以及，把\"模型说不知道\"当作一个成功输出，而不是一次失败。\n模型负责突破边界，系统负责守住边界。这两件事不会由同一方完成。\n结语：风险在空白处\n必须说清楚的是，专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路：从粗糙的通用，走向精细的分工。尖刺意味着效率，意味着某些真实问题第一次被彻底解决。这是好事。\n真正需要修正的，是认知。\n不要把一项能力的极致表现，误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美，就假设它在你没测试过的场景里同样可靠。当AI从\"能说\"走向\"能做\"，值得关注的重点也必须从\"它能做到什么\"，转向\"它在哪些地方仍然存在边界\"。\n因为决定未来系统安全性的，往往不是那根最锋利的尖刺。\n而是尖刺之间，那些还没有被人看见的空白。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.huxiu.com/article/4879222.html%3Ftype%3Dtext","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3036 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3036 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3036,"summary_length":3036,"usable_text_length":3036,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3036,"summary_length":3036}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/49026","export_markdown":"/api/items/49026/export?format=markdown","export_json":"/api/items/49026/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.huxiu.com/article/4879222.html%3Ftype%3Dtext"},"formats":{"full":{"id":49026,"title":"大模型越来越强，还是越来越尖？ - 虎嗅网","url":"https://www.huxiu.com/article/4879222.html?type=text","source":"虎嗅网","author":null,"published_at":"2026-07-29T15:11:04+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs\n当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。\n一、一个被反复验证的直觉\n过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。\n这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向，都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务，今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满，然后被废弃，然后被更难的测试取代。\n于是一个推论被自然地接受下来：如果所有能力都在增长，那么它们最终一定会汇聚成完整的智能。\n问题在于，这个推论中藏着一个未经检验的前提——所有能力都在增长，并不等于所有能力都在以同样的速度增长。\n二、球体，还是尖刺\n如果把一个智能系统的全部能力想象成一个球体，那么\"通用智能\"意味着球体从各个方向均匀膨胀：写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力，同步变强。\n但过去三年的实际轨迹更像另一种形状。\n代码能力增长极快，因为它可编译、可测试、可自动打分。数学推理增长极快，因为答案唯一，反馈信号干净。工具调用日趋成熟，因为它直接对应可交付的产品形态。多模态迅速扩张，因为它带来最直观的演示效果。\n与此同时，另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案；仍然会在多条件任务中悄悄丢掉一个约束；仍然会被上下文里一句无关的话带偏；仍然会在一条二十步的执行链中，从第七步开始缓慢偏离原本的目标，而每一步看起来都合理。\n这些能力不属于同一个增长曲线。它们不好量化，不好打分，因此也不好优化。\n结果不是一个越来越大的球，而是一个越来越不规则的形状：某几个方向被剧烈拉长，其余部分基本保持原样。\n三、谁在决定尖刺的方向\n问\"是什么在推动能力增长\"，最常见的回答是技术。更准确的回答是：目标函数。\n今天的模型不是自由生长的生物，它没有自己的兴趣。它的每一个能力方向，都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。\n一个每天接受代码测评的模型，会越来越擅长写代码。一个持续因正确解题而获得奖励的模型，会越来越擅长解题。一个不断在Agent基准上被打分的模型，会越来越擅长调用工具。\n反过来说也成立：一个从未被奖励\"说我不知道\"的模型，不会主动学会克制。\n模型不会自己选择成长方向，它只是把我们的评价标准，翻译成了能力的形状。\n四、商业引力：市场正在雕刻智能\n在目标函数之上，还有一股更强的力量在起作用——收入。\n前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下，\"哪些能力最值得投入算力\"这个问题，答案往往非常现实：\n企业客户愿意付费的能力；能转化为订阅的能力；能嵌入办公流程的能力；能提高开发者效率的能力；能支撑自动化Agent的能力。\n这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快，又会带来更多收入，进而拿到更多资源。这是一个自我强化的循环。\n那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。\n市场不只是在决定产品形态，它同时也在决定智能本身的形状。\n五、尖刺经济学\n对单个厂商来说，长出尖刺不是失误，而是最优策略。\n在一个高度同质化的竞争市场里，\"全面均衡\"是一种昂贵且难以传达的定位。没有人会因为一个模型\"各方面都还不错\"而更换供应商，但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根：这家的代码智能体，那家的检索与信息整合，另一家的视频生成，还有一家的超长上下文。\n竞争的结果，是模型之间的差异不断扩大，而不是收敛。\n行业看起来在赛跑，实际上在分岔。\n对使用者而言，这意味着\"用哪个模型\"正在从一个采购决策，变成一个架构决策。你不再是选一个更聪明的大脑，而是在为一组具体任务，挑选一组形状匹配的工具。\n六、能力不会自动迁移\n真正的风险不在尖刺本身，而在人类对尖刺的解读。\n我们习惯于用局部能力推断整体水平，因为在人类身上这个推断大致成立：一个能读懂复杂论文的人，通常也能读懂合同。但在模型身上，这条经验并不可靠。\n一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样，一个能解出国际数学竞赛题目的模型，并不因此就能可靠地管理一套企业审批流程；一个能写出优秀代码的模型，并不因此就能承担临床诊断中的责任链条。\n能力不会自动迁移，但人们对能力的信任会。\n这正是最危险的地方：模型在演示中展现的极限表现，会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节，误差就不再是误差，而是事故。\n七、Agent时代：最弱一环定义天花板\n这个问题在生成内容的时代还可以忍受。写错一段文案，成本是人工重写。\n但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强，被授予的权限越大；权限越大，一次偏离的代价越高。\n而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里，决定系统安全性的从来不是最强的那项能力。\n一个系统的可靠性，由它最弱的一环定义，而不是最锋利的那根尖刺。\n一个在标准任务上表现优异、但在遇到未见过的异常时倾向于\"编一个合理答案继续执行\"的智能体，恰恰是最难防的一类：它的失败不表现为报错和中断，而表现为流畅、自信、格式正确地把错误推进到下一步。\n八、企业的问题正在改变\n过去两年，企业技术选型的核心问题是：哪个模型最强？谁排行榜第一？哪个版本的分数更高？\n未来两年，这个问题很可能被替换掉。\n哪个系统最可靠？哪个系统的输出最容易被验证？哪个系统能在模型犯错时，把错误拦在它进入现实世界之前？出问题以后，我们能不能定位、回滚、解释？\n这是一种范式转移：从追逐能力上限，转向经营能力边界。\n具体地说，它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点；把不可逆操作与可逆操作分离；为智能体设定最小必要权限而非最大可用权限；建立独立于模型自身判断的校验层；以及，把\"模型说不知道\"当作一个成功输出，而不是一次失败。\n模型负责突破边界，系统负责守住边界。这两件事不会由同一方完成。\n结语：风险在空白处\n必须说清楚的是，专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路：从粗糙的通用，走向精细的分工。尖刺意味着效率，意味着某些真实问题第一次被彻底解决。这是好事。\n真正需要修正的，是认知。\n不要把一项能力的极致表现，误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美，就假设它在你没测试过的场景里同样可靠。当AI从\"能说\"走向\"能做\"，值得关注的重点也必须从\"它能做到什么\"，转向\"它在哪些地方仍然存在边界\"。\n因为决定未来系统安全性的，往往不是那根最锋利的尖刺。\n而是尖刺之间，那些还没有被人看见的空白。","full_text":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs\n当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。\n一、一个被反复验证的直觉\n过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。\n这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向，都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务，今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满，然后被废弃，然后被更难的测试取代。\n于是一个推论被自然地接受下来：如果所有能力都在增长，那么它们最终一定会汇聚成完整的智能。\n问题在于，这个推论中藏着一个未经检验的前提——所有能力都在增长，并不等于所有能力都在以同样的速度增长。\n二、球体，还是尖刺\n如果把一个智能系统的全部能力想象成一个球体，那么\"通用智能\"意味着球体从各个方向均匀膨胀：写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力，同步变强。\n但过去三年的实际轨迹更像另一种形状。\n代码能力增长极快，因为它可编译、可测试、可自动打分。数学推理增长极快，因为答案唯一，反馈信号干净。工具调用日趋成熟，因为它直接对应可交付的产品形态。多模态迅速扩张，因为它带来最直观的演示效果。\n与此同时，另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案；仍然会在多条件任务中悄悄丢掉一个约束；仍然会被上下文里一句无关的话带偏；仍然会在一条二十步的执行链中，从第七步开始缓慢偏离原本的目标，而每一步看起来都合理。\n这些能力不属于同一个增长曲线。它们不好量化，不好打分，因此也不好优化。\n结果不是一个越来越大的球，而是一个越来越不规则的形状：某几个方向被剧烈拉长，其余部分基本保持原样。\n三、谁在决定尖刺的方向\n问\"是什么在推动能力增长\"，最常见的回答是技术。更准确的回答是：目标函数。\n今天的模型不是自由生长的生物，它没有自己的兴趣。它的每一个能力方向，都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。\n一个每天接受代码测评的模型，会越来越擅长写代码。一个持续因正确解题而获得奖励的模型，会越来越擅长解题。一个不断在Agent基准上被打分的模型，会越来越擅长调用工具。\n反过来说也成立：一个从未被奖励\"说我不知道\"的模型，不会主动学会克制。\n模型不会自己选择成长方向，它只是把我们的评价标准，翻译成了能力的形状。\n四、商业引力：市场正在雕刻智能\n在目标函数之上，还有一股更强的力量在起作用——收入。\n前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下，\"哪些能力最值得投入算力\"这个问题，答案往往非常现实：\n企业客户愿意付费的能力；能转化为订阅的能力；能嵌入办公流程的能力；能提高开发者效率的能力；能支撑自动化Agent的能力。\n这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快，又会带来更多收入，进而拿到更多资源。这是一个自我强化的循环。\n那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。\n市场不只是在决定产品形态，它同时也在决定智能本身的形状。\n五、尖刺经济学\n对单个厂商来说，长出尖刺不是失误，而是最优策略。\n在一个高度同质化的竞争市场里，\"全面均衡\"是一种昂贵且难以传达的定位。没有人会因为一个模型\"各方面都还不错\"而更换供应商，但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根：这家的代码智能体，那家的检索与信息整合，另一家的视频生成，还有一家的超长上下文。\n竞争的结果，是模型之间的差异不断扩大，而不是收敛。\n行业看起来在赛跑，实际上在分岔。\n对使用者而言，这意味着\"用哪个模型\"正在从一个采购决策，变成一个架构决策。你不再是选一个更聪明的大脑，而是在为一组具体任务，挑选一组形状匹配的工具。\n六、能力不会自动迁移\n真正的风险不在尖刺本身，而在人类对尖刺的解读。\n我们习惯于用局部能力推断整体水平，因为在人类身上这个推断大致成立：一个能读懂复杂论文的人，通常也能读懂合同。但在模型身上，这条经验并不可靠。\n一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样，一个能解出国际数学竞赛题目的模型，并不因此就能可靠地管理一套企业审批流程；一个能写出优秀代码的模型，并不因此就能承担临床诊断中的责任链条。\n能力不会自动迁移，但人们对能力的信任会。\n这正是最危险的地方：模型在演示中展现的极限表现，会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节，误差就不再是误差，而是事故。\n七、Agent时代：最弱一环定义天花板\n这个问题在生成内容的时代还可以忍受。写错一段文案，成本是人工重写。\n但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强，被授予的权限越大；权限越大，一次偏离的代价越高。\n而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里，决定系统安全性的从来不是最强的那项能力。\n一个系统的可靠性，由它最弱的一环定义，而不是最锋利的那根尖刺。\n一个在标准任务上表现优异、但在遇到未见过的异常时倾向于\"编一个合理答案继续执行\"的智能体，恰恰是最难防的一类：它的失败不表现为报错和中断，而表现为流畅、自信、格式正确地把错误推进到下一步。\n八、企业的问题正在改变\n过去两年，企业技术选型的核心问题是：哪个模型最强？谁排行榜第一？哪个版本的分数更高？\n未来两年，这个问题很可能被替换掉。\n哪个系统最可靠？哪个系统的输出最容易被验证？哪个系统能在模型犯错时，把错误拦在它进入现实世界之前？出问题以后，我们能不能定位、回滚、解释？\n这是一种范式转移：从追逐能力上限，转向经营能力边界。\n具体地说，它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点；把不可逆操作与可逆操作分离；为智能体设定最小必要权限而非最大可用权限；建立独立于模型自身判断的校验层；以及，把\"模型说不知道\"当作一个成功输出，而不是一次失败。\n模型负责突破边界，系统负责守住边界。这两件事不会由同一方完成。\n结语：风险在空白处\n必须说清楚的是，专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路：从粗糙的通用，走向精细的分工。尖刺意味着效率，意味着某些真实问题第一次被彻底解决。这是好事。\n真正需要修正的，是认知。\n不要把一项能力的极致表现，误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美，就假设它在你没测试过的场景里同样可靠。当AI从\"能说\"走向\"能做\"，值得关注的重点也必须从\"它能做到什么\"，转向\"它在哪些地方仍然存在边界\"。\n因为决定未来系统安全性的，往往不是那根最锋利的尖刺。\n而是尖刺之间，那些还没有被人看见的空白。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3036 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.huxiu.com/article/4879222.html%3Ftype%3Dtext","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3036 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3036,"summary_length":3036,"usable_text_length":3036,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3036,"summary_length":3036}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3036 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3036,"summary_length":3036,"usable_text_length":3036,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3036,"summary_length":3036}},"actions":{"read":"/item/49026","export_markdown":"/api/items/49026/export?format=markdown","export_json":"/api/items/49026/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.huxiu.com/article/4879222.html%3Ftype%3Dtext"}},"digest":{"id":49026,"title":"大模型越来越强，还是越来越尖？ - 虎嗅网","url":"https://www.huxiu.com/article/4879222.html?type=text","source":"虎嗅网","topic":"ai","published_at":"2026-07-29T15:11:04+00:00","excerpt":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs 当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。 一、一个被反复验证的直觉 过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 3036 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"大模型越来越强，还是越来越尖？ - 虎嗅网","subtitle":"虎嗅网 · 2026-07-29","summary":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs 当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。 一、一个被反复验证的直觉 过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。…","badges":["quality:high"],"links":{"read":"/item/49026","original":"https://www.huxiu.com/article/4879222.html?type=text","diagnose":"/api/diagnose?url=https%3A//www.huxiu.com/article/4879222.html%3Ftype%3Dtext"},"quality_warning":null},"export":{"title":"大模型越来越强，还是越来越尖？ - 虎嗅网","url":"https://www.huxiu.com/article/4879222.html?type=text","summary":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs\n当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。\n一、一个被反复验证的直觉\n过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。\n这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向，都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务，今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满，然后被废弃，然后被更难的测试取代。\n于是一个推论被自然地接受下来：如果所有能力都在增长，那么它们最终一定会汇聚成完整的智能。\n问题在于，这个推论中藏着一个未经检验的前提——所有能力都在增长，并不等于所有能力都在以同样的速度增长。\n二、球体，还是尖刺\n如果把一个智能系统的全部能力想象成一个球体，那么\"通用智能\"意味着球体从各个方向均匀膨胀：写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力，同步变强。\n但过去三年的实际轨迹更像另一种形状。\n代码能力增长极快，因为它可编译、可测试、可自动打分。数学推理增长极快，因为答案唯一，反馈信号干净。工具调用日趋成熟，因为它直接对应可交付的产品形态。多模态迅速扩张，因为它带来最直观的演示效果。\n与此同时，另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案；仍然会在多条件任务中悄悄丢掉一个约束；仍然会被上下文里一句无关的话带偏；仍然会在一条二十步的执行链中，从第七步开始缓慢偏离原本的目标，而每一步看起来都合理。\n这些能力不属于同一个增长曲线。它们不好量化，不好打分，因此也不好优化。\n结果不是一个越来越大的球，而是一个越来越不规则的形状：某几个方向被剧烈拉长，其余部分基本保持原样。\n三、谁在决定尖刺的方向\n问\"是什么在推动能力增长\"，最常见的回答是技术。更准确的回答是：目标函数。\n今天的模型不是自由生长的生物，它没有自己的兴趣。它的每一个能力方向，都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。\n一个每天接受代码测评的模型，会越来越擅长写代码。一个持续因正确解题而获得奖励的模型，会越来越擅长解题。一个不断在Agent基准上被打分的模型，会越来越擅长调用工具。\n反过来说也成立：一个从未被奖励\"说我不知道\"的模型，不会主动学会克制。\n模型不会自己选择成长方向，它只是把我们的评价标准，翻译成了能力的形状。\n四、商业引力：市场正在雕刻智能\n在目标函数之上，还有一股更强的力量在起作用——收入。\n前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下，\"哪些能力最值得投入算力\"这个问题，答案往往非常现实：\n企业客户愿意付费的能力；能转化为订阅的能力；能嵌入办公流程的能力；能提高开发者效率的能力；能支撑自动化Agent的能力。\n这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快，又会带来更多收入，进而拿到更多资源。这是一个自我强化的循环。\n那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。\n市场不只是在决定产品形态，它同时也在决定智能本身的形状。\n五、尖刺经济学\n对单个厂商来说，长出尖刺不是失误，而是最优策略。\n在一个高度同质化的竞争市场里，\"全面均衡\"是一种昂贵且难以传达的定位。没有人会因为一个模型\"各方面都还不错\"而更换供应商，但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根：这家的代码智能体，那家的检索与信息整合，另一家的视频生成，还有一家的超长上下文。\n竞争的结果，是模型之间的差异不断扩大，而不是收敛。\n行业看起来在赛跑，实际上在分岔。\n对使用者而言，这意味着\"用哪个模型\"正在从一个采购决策，变成一个架构决策。你不再是选一个更聪明的大脑，而是在为一组具体任务，挑选一组形状匹配的工具。\n六、能力不会自动迁移\n真正的风险不在尖刺本身，而在人类对尖刺的解读。\n我们习惯于用局部能力推断整体水平，因为在人类身上这个推断大致成立：一个能读懂复杂论文的人，通常也能读懂合同。但在模型身上，这条经验并不可靠。\n一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样，一个能解出国际数学竞赛题目的模型，并不因此就能可靠地管理一套企业审批流程；一个能写出优秀代码的模型，并不因此就能承担临床诊断中的责任链条。\n能力不会自动迁移，但人们对能力的信任会。\n这正是最危险的地方：模型在演示中展现的极限表现，会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节，误差就不再是误差，而是事故。\n七、Agent时代：最弱一环定义天花板\n这个问题在生成内容的时代还可以忍受。写错一段文案，成本是人工重写。\n但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强，被授予的权限越大；权限越大，一次偏离的代价越高。\n而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里，决定系统安全性的从来不是最强的那项能力。\n一个系统的可靠性，由它最弱的一环定义，而不是最锋利的那根尖刺。\n一个在标准任务上表现优异、但在遇到未见过的异常时倾向于\"编一个合理答案继续执行\"的智能体，恰恰是最难防的一类：它的失败不表现为报错和中断，而表现为流畅、自信、格式正确地把错误推进到下一步。\n八、企业的问题正在改变\n过去两年，企业技术选型的核心问题是：哪个模型最强？谁排行榜第一？哪个版本的分数更高？\n未来两年，这个问题很可能被替换掉。\n哪个系统最可靠？哪个系统的输出最容易被验证？哪个系统能在模型犯错时，把错误拦在它进入现实世界之前？出问题以后，我们能不能定位、回滚、解释？\n这是一种范式转移：从追逐能力上限，转向经营能力边界。\n具体地说，它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点；把不可逆操作与可逆操作分离；为智能体设定最小必要权限而非最大可用权限；建立独立于模型自身判断的校验层；以及，把\"模型说不知道\"当作一个成功输出，而不是一次失败。\n模型负责突破边界，系统负责守住边界。这两件事不会由同一方完成。\n结语：风险在空白处\n必须说清楚的是，专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路：从粗糙的通用，走向精细的分工。尖刺意味着效率，意味着某些真实问题第一次被彻底解决。这是好事。\n真正需要修正的，是认知。\n不要把一项能力的极致表现，误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美，就假设它在你没测试过的场景里同样可靠。当AI从\"能说\"走向\"能做\"，值得关注的重点也必须从\"它能做到什么\"，转向\"它在哪些地方仍然存在边界\"。\n因为决定未来系统安全性的，往往不是那根最锋利的尖刺。\n而是尖刺之间，那些还没有被人看见的空白。","source":"虎嗅网","date":"2026-07-29T15:11:04+00:00","content":"本文来自微信公众号： HavenlonLabs ，作者：Havenlon Labs\n当训练目标、评测体系和商业利益共同雕刻智能的形状，我们得到的可能不是一颗不断膨胀的球，而是一束越来越锋利的尖刺。\n一、一个被反复验证的直觉\n过去几年，行业内部形成了一种近乎共识的叙事：参数规模持续扩大，训练数据持续增加，推理链条持续加长，人工智能正沿着一条清晰的斜坡，稳步逼近通用智能。\n这种直觉并非空穴来风。语言理解、代码生成、数学推理、长文本处理、工具调用、图像与视频生成——几乎每一个方向，都在以季度为单位刷新上限。曾经需要一个专业团队工作数周的任务，今天一个模型在几分钟内就能交付一份可用的初稿。基准测试一个接一个被刷满，然后被废弃，然后被更难的测试取代。\n于是一个推论被自然地接受下来：如果所有能力都在增长，那么它们最终一定会汇聚成完整的智能。\n问题在于，这个推论中藏着一个未经检验的前提——所有能力都在增长，并不等于所有能力都在以同样的速度增长。\n二、球体，还是尖刺\n如果把一个智能系统的全部能力想象成一个球体，那么\"通用智能\"意味着球体从各个方向均匀膨胀：写代码的能力、判断歧义的能力、承认不知道的能力、在长任务中不跑偏的能力，同步变强。\n但过去三年的实际轨迹更像另一种形状。\n代码能力增长极快，因为它可编译、可测试、可自动打分。数学推理增长极快，因为答案唯一，反馈信号干净。工具调用日趋成熟，因为它直接对应可交付的产品形态。多模态迅速扩张，因为它带来最直观的演示效果。\n与此同时，另一些老问题几乎原地踏步。模型仍然会在没有依据时给出流畅而自信的错误答案；仍然会在多条件任务中悄悄丢掉一个约束；仍然会被上下文里一句无关的话带偏；仍然会在一条二十步的执行链中，从第七步开始缓慢偏离原本的目标，而每一步看起来都合理。\n这些能力不属于同一个增长曲线。它们不好量化，不好打分，因此也不好优化。\n结果不是一个越来越大的球，而是一个越来越不规则的形状：某几个方向被剧烈拉长，其余部分基本保持原样。\n三、谁在决定尖刺的方向\n问\"是什么在推动能力增长\"，最常见的回答是技术。更准确的回答是：目标函数。\n今天的模型不是自由生长的生物，它没有自己的兴趣。它的每一个能力方向，都来自人类设定的优化信号——训练什么、奖励什么、评测什么、在排行榜上比什么。\n一个每天接受代码测评的模型，会越来越擅长写代码。一个持续因正确解题而获得奖励的模型，会越来越擅长解题。一个不断在Agent基准上被打分的模型，会越来越擅长调用工具。\n反过来说也成立：一个从未被奖励\"说我不知道\"的模型，不会主动学会克制。\n模型不会自己选择成长方向，它只是把我们的评价标准，翻译成了能力的形状。\n四、商业引力：市场正在雕刻智能\n在目标函数之上，还有一股更强的力量在起作用——收入。\n前沿模型公司不是研究所。它们要付电费、买芯片、招工程师、面对投资人的下一轮估值。在这样的约束下，\"哪些能力最值得投入算力\"这个问题，答案往往非常现实：\n企业客户愿意付费的能力；能转化为订阅的能力；能嵌入办公流程的能力；能提高开发者效率的能力；能支撑自动化Agent的能力。\n这些方向拿到了最多的算力、最强的团队、最精细的数据标注、最完整的评测体系。于是它们增长得更快。而增长得更快，又会带来更多收入，进而拿到更多资源。这是一个自我强化的循环。\n那些短期内无法直接变现的能力——对模糊问题的判断力、对自身边界的诚实、在开放世界中保持稳定的一致性——则长期停留在优先级列表的下半部分。\n市场不只是在决定产品形态，它同时也在决定智能本身的形状。\n五、尖刺经济学\n对单个厂商来说，长出尖刺不是失误，而是最优策略。\n在一个高度同质化的竞争市场里，\"全面均衡\"是一种昂贵且难以传达的定位。没有人会因为一个模型\"各方面都还不错\"而更换供应商，但会因为它在某一件事上明显更强而迁移。于是每一家公司都在寻找并放大自己最锋利的那一根：这家的代码智能体，那家的检索与信息整合，另一家的视频生成，还有一家的超长上下文。\n竞争的结果，是模型之间的差异不断扩大，而不是收敛。\n行业看起来在赛跑，实际上在分岔。\n对使用者而言，这意味着\"用哪个模型\"正在从一个采购决策，变成一个架构决策。你不再是选一个更聪明的大脑，而是在为一组具体任务，挑选一组形状匹配的工具。\n六、能力不会自动迁移\n真正的风险不在尖刺本身，而在人类对尖刺的解读。\n我们习惯于用局部能力推断整体水平，因为在人类身上这个推断大致成立：一个能读懂复杂论文的人，通常也能读懂合同。但在模型身上，这条经验并不可靠。\n一个围棋冠军不会自动成为数学家。一个顶级程序员不会自动成为心理咨询师。同样，一个能解出国际数学竞赛题目的模型，并不因此就能可靠地管理一套企业审批流程；一个能写出优秀代码的模型，并不因此就能承担临床诊断中的责任链条。\n能力不会自动迁移，但人们对能力的信任会。\n这正是最危险的地方：模型在演示中展现的极限表现，会被无声地推广成对它全部行为的预期。当那个预期被写进流程、写进权限、写进无人复核的自动化环节，误差就不再是误差，而是事故。\n七、Agent时代：最弱一环定义天花板\n这个问题在生成内容的时代还可以忍受。写错一段文案，成本是人工重写。\n但模型正在离开对话框。它开始调用API、查询和修改数据库、变更配置、发起交易、管理基础设施、控制物理设备。能力越强，被授予的权限越大；权限越大，一次偏离的代价越高。\n而现实世界并不按照模型最擅长的方向运行。它由例外、异常、过期文档、口头约定和边界条件构成。在这样的环境里，决定系统安全性的从来不是最强的那项能力。\n一个系统的可靠性，由它最弱的一环定义，而不是最锋利的那根尖刺。\n一个在标准任务上表现优异、但在遇到未见过的异常时倾向于\"编一个合理答案继续执行\"的智能体，恰恰是最难防的一类：它的失败不表现为报错和中断，而表现为流畅、自信、格式正确地把错误推进到下一步。\n八、企业的问题正在改变\n过去两年，企业技术选型的核心问题是：哪个模型最强？谁排行榜第一？哪个版本的分数更高？\n未来两年，这个问题很可能被替换掉。\n哪个系统最可靠？哪个系统的输出最容易被验证？哪个系统能在模型犯错时，把错误拦在它进入现实世界之前？出问题以后，我们能不能定位、回滚、解释？\n这是一种范式转移：从追逐能力上限，转向经营能力边界。\n具体地说，它意味着几件不那么性感但更值钱的工作——为每一类高风险动作设置人工确认点；把不可逆操作与可逆操作分离；为智能体设定最小必要权限而非最大可用权限；建立独立于模型自身判断的校验层；以及，把\"模型说不知道\"当作一个成功输出，而不是一次失败。\n模型负责突破边界，系统负责守住边界。这两件事不会由同一方完成。\n结语：风险在空白处\n必须说清楚的是，专业化本身不是问题。技术史上几乎所有成熟领域都走过同一条路：从粗糙的通用，走向精细的分工。尖刺意味着效率，意味着某些真实问题第一次被彻底解决。这是好事。\n真正需要修正的，是认知。\n不要把一项能力的极致表现，误读成整体智能的成熟。不要因为一个系统在你测试过的场景里表现完美，就假设它在你没测试过的场景里同样可靠。当AI从\"能说\"走向\"能做\"，值得关注的重点也必须从\"它能做到什么\"，转向\"它在哪些地方仍然存在边界\"。\n因为决定未来系统安全性的，往往不是那根最锋利的尖刺。\n而是尖刺之间，那些还没有被人看见的空白。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.huxiu.com/article/4879222.html%3Ftype%3Dtext","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3036 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3036 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3036,"summary_length":3036,"usable_text_length":3036,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3036,"summary_length":3036}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}