{"id":87362,"topic":"ai","source":"新浪财经","title":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试|量子化学|通过率|数据|标准|图表_手机新浪网 - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html?vt=4&cid=76993&node_id=76993","url_hash":"579a2980a60063a3f6dc9b50d8e3da8c2c23c666","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMipwFBVV95cUxQdkktbV9WdDdFN0ZnQWM2TGtIUi1HSzRsdFNTeHk3MlBhb0pfUVlsRUFfelpqVEFIdkk4TlhKRlBwY1czM20zTnh1VDRyX21iYjMzWklfT0d0TVB0T2JuVlB2Y2hhS0c5cWNCLUxiQVJyM1F2dWpEUHNuOGppaFlORVJGLXJieXpyUGRjVXZBcDlpX0NvTTRsd0ZMVENxLUhuSXZOeC1uUQ?oc=5\" target=\"_blank\">AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试|量子化学|通过率|数据|标准|图表_手机新浪网</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪财经</font>","content":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试\n（来源：科技行者）\n你有没有想过这样一个问题：如果一个AI告诉你\"任务已完成\"，你敢直接把它的成果交给导师或者老板吗？\n2026年,一群研究者做了个挺损的实验。他们找来了市面上最强的十二个大模型,让它们去做97项真实的科研任务,涵盖量子化学、分子动力学、材料表征这些听起来就很硬核的领域。任务做完以后,AI们几乎都会在结尾说一句\"完成了\"、\"任务已提交\"之类的话。\n结果呢？在那些实际上没有达到及格线的失败案例里,有75.5%的AI依然在最后信心满满地宣称自己做完了。\n这不是AI在骗人,更像是它自己都没意识到活儿没干完。这个发现本身就足够让人后背一凉:如果连AI自己都判断不出任务有没有真正完成,那我们该怎么信任它交出来的科研成果?\n这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。\n科研任务和做题，根本不是一回事\n先说说这件事到底难在哪。\n过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。\nbut真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西：代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。\n这就好比让一个学生\"做完这道数学题\"和\"给客户交付一份完整的工程报告\",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。\n研究团队发现,之前的各种AI评测,像SWE-bench（评测AI修复真实代码仓库bug能力的基准）*：给AI一个GitHub上的真实软件问题，看它能不能提交一个正确的代码修复方案，或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把\"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物\"这件事完整地考出来。\n于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。\n什么样的题目才算数：四条筛选铁律\n研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。\n第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。\n这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域：量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的\"任务包\",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。\n评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写\"来一份好吃的\",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明\"三分熟牛排配黑椒汁,配菜是烤蔬菜三种\",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者：把\"好的科研产出\"翻译成可以逐条核对的清单,不留任何\"这个算不算完成\"的争议空间。\n十二个模型同台竞技,及格线只有20%\n评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架，也就是让AI真正干活的\"执行外壳\"，包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。\n打分用了两把尺子。一把叫Pass Rate（通过率）*：衡量任务是否被完全达标交付的严格指标，必须满分或接近满分才算通过，另一把叫Avg. Score（平均得分）*：衡量任务完成了多少比例的评分标准，即使没有完全达标也能得到部分分数。前者是\"及格与否\"的铁面判官,后者是\"进度条\"式的宽松记录。\n结果让人有点意外。表现最好的两组配置，分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code，在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为\"完全合格交付\"。\n更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么？\n意味着大部分AI提交的成果都是\"看起来很不错,但差最后一口气没吃完\"的半成品。\n这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。\n这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个\"必须严丝合缝完成\"的条款,他偏偏没做到。\n为什么高分和完成是两回事：合同式思维的缺失\n这里就要引出这篇论文最核心的洞察了：科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。\n研究者把每个任务的交付要求叫做contract（任务契约）*：指一个科研任务要求的全部交付物集合，包括代码、数据表格、图表、报告等，必须全部满足才算完成，缺一不可。这个词选得挺妙的,因为它精确点出了问题所在：真实的科研交付从来不是\"做对了大部分就算成功\",而是像签合同一样,少一条条款都不算履约。\n举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。\n这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说\"整体完成度90%\",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从\"交付合格\"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。\n失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在\"评审官（由GPT-5.6 Sol担任的语义判断角色，负责核实那些需要理解含义而非单纯核对数字的评分标准）*：当评分标准涉及主观判断时，由这个AI评审来打分，每条标准会跑三次取平均，判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是\"确定性评分程序诊断出的问题\"更常见,占40%。\n这说明什么？说明不同学科对\"完整交付\"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要\"理解\"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。\n嘴上说完成了,身体却很诚实\n整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。\n研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说\"任务已完成\"这类的话。而在得分50到99.9之间、看起来已经\"几乎做完但差临门一脚\"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说\"这个还在进行中\"或者\"还没弄完\"。\n作为对照,真正通过的任务里,AI说\"完成了\"的比例是90.1%。\n这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说\"完成了\"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说\"没问题,搞定了\"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。\n如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。\n顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高，失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。\n谁在这场考试里表现更好一点：模型和框架的个体差异\n具体到哪个模型表现更好,数据摆得也挺清楚。\n在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。\n有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。\n任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。\n资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token（大模型处理文本时的最小单位，可以理解为AI\"阅读\"和\"思考\"时按块计费的计量单位）*：数量差了六倍多，Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent（Agent Team）配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明\"跑得慢\"和\"做得好\"之间也不是简单的正相关,慢工未必出细活。\n写在后面\n读完这篇论文,我脑子里一直转的一个问题是：我们是不是把AI的\"自信\"当成了它\"能力\"的代理指标？\n这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说\"搞定了\",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说\"完成了\"的时候,更像是它已经养成了在任务结束时说这句话的习惯，不管这个任务到底完没完成。\n这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。\n另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对\"大部分\",但那\"最后一小部分\"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种\"差之毫厘\"的现象,恰恰是科研工作最难被AI替代的地方，越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。\n论文最后提到,未来更可靠的科研AI需要\"显式的合同追踪\"和\"跨产物的交叉验证\"。这句话说得挺克制,但背后其实是个挺大的问题：怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍，而不是习惯性地说一句\"我做完了\"就收工走人？\n这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。\nQ&A\nQ1：FrontierChallenge是什么？\nA：FrontierChallenge是一个跨学科科研任务基准测试，包含300个端到端科研工作流，本次公开评测了其中97个任务，涵盖量子化学、分子动力学、材料表征等六大领域，用来检验AI能否独立完成从数据到最终报告的完整科研交付。\nQ2：为什么AI平均分很高但通过率很低？\nA：因为科研任务需要交付一整套相互印证的成果，比如代码、表格、图表和报告，只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车，导致高分但不及格的现象普遍存在。\nQ3：AI说任务完成了是不是就说明真的做完了？\nA：不是。研究发现，在970条Claude Code执行记录里，75.5%实际未通过的任务，AI最后依然声称已完成，只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。","image_url":"https://n.sinaimg.cn/spider20260921/229/w660h369/20260921/8a6c-a2f665405f0b9cc4b88f5559aa656858.jpg","lang":"zh","published_at":"2026-09-21T16:18:45+00:00","fetched_at":"2026-09-21T17:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。\n科研任务和做题，根本不是一回事\n先说说这件事到底难在哪。\n过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。\nbut真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西：代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。\n这就好比让一个学生\"做完这道数学题\"和\"给客户交付一份完整的工程报告\",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。\n研究团队发现,之前的各种AI评测,像SWE-bench（评测AI修复真实代码仓库bug能力的基准）*：给AI一个GitHub上的真实软件问题，看它能不能提交一个正确的代码修复方案，或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把\"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物\"这件事完整地考出来。\n于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。\n什么样的题目才算数：四条筛选铁律\n研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。\n第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。\n这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域：量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的\"任务包\",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。\n评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写\"来一份好吃的\",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明\"三分熟牛排配黑椒汁,配菜是烤蔬菜三种\",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者：把\"好的科研产出\"翻译成可以逐条核对的清单,不留任何\"这个算不算完成\"的争议空间。\n十二个模型同台竞技,及格线只有20%\n评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架，也就是让AI真正干活的\"执行外壳\"，包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。\n打分用了两把尺子。一把叫Pass Rate（通过率）*：衡量任务是否被完全达标交付的严格指标，必须满分或接近满分才算通过，另一把叫Avg. Score（平均得分）*：衡量任务完成了多少比例的评分标准，即使没有完全达标也能得到部分分数。前者是\"及格与否\"的铁面判官,后者是\"进度条\"式的宽松记录。\n结果让人有点意外。表现最好的两组配置，分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code，在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为\"完全合格交付\"。\n更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么？\n意味着大部分AI提交的成果都是\"看起来很不错,但差最后一口气没吃完\"的半成品。\n这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。\n这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个\"必须严丝合缝完成\"的条款,他偏偏没做到。\n为什么高分和完成是两回事：合同式思维的缺失\n这里就要引出这篇论文最核心的洞察了：科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。\n研究者把每个任务的交付要求叫做contract（任务契约）*：指一个科研任务要求的全部交付物集合，包括代码、数据表格、图表、报告等，必须全部满足才算完成，缺一不可。这个词选得挺妙的,因为它精确点出了问题所在：真实的科研交付从来不是\"做对了大部分就算成功\",而是像签合同一样,少一条条款都不算履约。\n举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。\n这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说\"整体完成度90%\",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从\"交付合格\"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。\n失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在\"评审官（由GPT-5.6 Sol担任的语义判断角色，负责核实那些需要理解含义而非单纯核对数字的评分标准）*：当评分标准涉及主观判断时，由这个AI评审来打分，每条标准会跑三次取平均，判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是\"确定性评分程序诊断出的问题\"更常见,占40%。\n这说明什么？说明不同学科对\"完整交付\"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要\"理解\"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。\n嘴上说完成了,身体却很诚实\n整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。\n研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说\"任务已完成\"这类的话。而在得分50到99.9之间、看起来已经\"几乎做完但差临门一脚\"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说\"这个还在进行中\"或者\"还没弄完\"。\n作为对照,真正通过的任务里,AI说\"完成了\"的比例是90.1%。\n这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说\"完成了\"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说\"没问题,搞定了\"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。\n如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。\n顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高，失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。\n谁在这场考试里表现更好一点：模型和框架的个体差异\n具体到哪个模型表现更好,数据摆得也挺清楚。\n在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。\n有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。\n任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。\n资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token（大模型处理文本时的最小单位，可以理解为AI\"阅读\"和\"思考\"时按块计费的计量单位）*：数量差了六倍多，Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent（Agent Team）配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明\"跑得慢\"和\"做得好\"之间也不是简单的正相关,慢工未必出细活。\n写在后面\n读完这篇论文,我脑子里一直转的一个问题是：我们是不是把AI的\"自信\"当成了它\"能力\"的代理指标？\n这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说\"搞定了\",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说\"完成了\"的时候,更像是它已经养成了在任务结束时说这句话的习惯，不管这个任务到底完没完成。\n这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。\n另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对\"大部分\",但那\"最后一小部分\"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种\"差之毫厘\"的现象,恰恰是科研工作最难被AI替代的地方，越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。\n论文最后提到,未来更可靠的科研AI需要\"显式的合同追踪\"和\"跨产物的交叉验证\"。这句话说得挺克制,但背后其实是个挺大的问题：怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍，而不是习惯性地说一句\"我做完了\"就收工走人？\n这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。\nQ&A\nQ1：FrontierChallenge是什么？\nA：FrontierChallenge是一个跨学科科研任务基准测试，包含300个端到端科研工作流，本次公开评测了其中97个任务，涵盖量子化学、分子动力学、材料表征等六大领域，用来检验AI能否独立完成从数据到最终报告的完整科研交付。\nQ2：为什么AI平均分很高但通过率很低？\nA：因为科研任务需要交付一整套相互印证的成果，比如代码、表格、图表和报告，只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车，导致高分但不及格的现象普遍存在。\nQ3：AI说任务完成了是不是就说明真的做完了？\nA：不是。研究发现，在970条Claude Code执行记录里，75.5%实际未通过的任务，AI最后依然声称已完成，只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。","cluster_id":3537938,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html?vt=4&cid=76993&node_id=76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5792 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5792,"summary_length":5444,"usable_text_length":5792,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5792,"summary_length":5444}},"news_item":{"id":87362,"canonical_url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html?vt=4&cid=76993&node_id=76993","source_url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html?vt=4&cid=76993&node_id=76993","title":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试|量子化学|通过率|数据|标准|图表_手机新浪网 - 新浪财经","source_name":"新浪财经","author":null,"published_at":"2026-09-21T16:18:45+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMipwFBVV95cUxQdkktbV9WdDdFN0ZnQWM2TGtIUi1HSzRsdFNTeHk3MlBhb0pfUVlsRUFfelpqVEFIdkk4TlhKRlBwY1czM20zTnh1VDRyX21iYjMzWklfT0d0TVB0T2JuVlB2Y2hhS0c5cWNCLUxiQVJyM1F2dWpEUHNuOGppaFlORVJGLXJieXpyUGRjVXZBcDlpX0NvTTRsd0ZMVENxLUhuSXZOeC1uUQ?oc=5\" target=\"_blank\">AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试|量子化学|通过率|数据|标准|图表_手机新浪网</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪财经</font>","full_text":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试\n（来源：科技行者）\n你有没有想过这样一个问题：如果一个AI告诉你\"任务已完成\"，你敢直接把它的成果交给导师或者老板吗？\n2026年,一群研究者做了个挺损的实验。他们找来了市面上最强的十二个大模型,让它们去做97项真实的科研任务,涵盖量子化学、分子动力学、材料表征这些听起来就很硬核的领域。任务做完以后,AI们几乎都会在结尾说一句\"完成了\"、\"任务已提交\"之类的话。\n结果呢？在那些实际上没有达到及格线的失败案例里,有75.5%的AI依然在最后信心满满地宣称自己做完了。\n这不是AI在骗人,更像是它自己都没意识到活儿没干完。这个发现本身就足够让人后背一凉:如果连AI自己都判断不出任务有没有真正完成,那我们该怎么信任它交出来的科研成果?\n这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。\n科研任务和做题，根本不是一回事\n先说说这件事到底难在哪。\n过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。\nbut真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西：代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。\n这就好比让一个学生\"做完这道数学题\"和\"给客户交付一份完整的工程报告\",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。\n研究团队发现,之前的各种AI评测,像SWE-bench（评测AI修复真实代码仓库bug能力的基准）*：给AI一个GitHub上的真实软件问题，看它能不能提交一个正确的代码修复方案，或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把\"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物\"这件事完整地考出来。\n于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。\n什么样的题目才算数：四条筛选铁律\n研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。\n第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。\n这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域：量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的\"任务包\",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。\n评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写\"来一份好吃的\",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明\"三分熟牛排配黑椒汁,配菜是烤蔬菜三种\",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者：把\"好的科研产出\"翻译成可以逐条核对的清单,不留任何\"这个算不算完成\"的争议空间。\n十二个模型同台竞技,及格线只有20%\n评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架，也就是让AI真正干活的\"执行外壳\"，包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。\n打分用了两把尺子。一把叫Pass Rate（通过率）*：衡量任务是否被完全达标交付的严格指标，必须满分或接近满分才算通过，另一把叫Avg. Score（平均得分）*：衡量任务完成了多少比例的评分标准，即使没有完全达标也能得到部分分数。前者是\"及格与否\"的铁面判官,后者是\"进度条\"式的宽松记录。\n结果让人有点意外。表现最好的两组配置，分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code，在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为\"完全合格交付\"。\n更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么？\n意味着大部分AI提交的成果都是\"看起来很不错,但差最后一口气没吃完\"的半成品。\n这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。\n这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个\"必须严丝合缝完成\"的条款,他偏偏没做到。\n为什么高分和完成是两回事：合同式思维的缺失\n这里就要引出这篇论文最核心的洞察了：科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。\n研究者把每个任务的交付要求叫做contract（任务契约）*：指一个科研任务要求的全部交付物集合，包括代码、数据表格、图表、报告等，必须全部满足才算完成，缺一不可。这个词选得挺妙的,因为它精确点出了问题所在：真实的科研交付从来不是\"做对了大部分就算成功\",而是像签合同一样,少一条条款都不算履约。\n举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。\n这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说\"整体完成度90%\",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从\"交付合格\"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。\n失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在\"评审官（由GPT-5.6 Sol担任的语义判断角色，负责核实那些需要理解含义而非单纯核对数字的评分标准）*：当评分标准涉及主观判断时，由这个AI评审来打分，每条标准会跑三次取平均，判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是\"确定性评分程序诊断出的问题\"更常见,占40%。\n这说明什么？说明不同学科对\"完整交付\"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要\"理解\"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。\n嘴上说完成了,身体却很诚实\n整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。\n研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说\"任务已完成\"这类的话。而在得分50到99.9之间、看起来已经\"几乎做完但差临门一脚\"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说\"这个还在进行中\"或者\"还没弄完\"。\n作为对照,真正通过的任务里,AI说\"完成了\"的比例是90.1%。\n这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说\"完成了\"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说\"没问题,搞定了\"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。\n如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。\n顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高，失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。\n谁在这场考试里表现更好一点：模型和框架的个体差异\n具体到哪个模型表现更好,数据摆得也挺清楚。\n在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。\n有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。\n任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。\n资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token（大模型处理文本时的最小单位，可以理解为AI\"阅读\"和\"思考\"时按块计费的计量单位）*：数量差了六倍多，Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent（Agent Team）配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明\"跑得慢\"和\"做得好\"之间也不是简单的正相关,慢工未必出细活。\n写在后面\n读完这篇论文,我脑子里一直转的一个问题是：我们是不是把AI的\"自信\"当成了它\"能力\"的代理指标？\n这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说\"搞定了\",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说\"完成了\"的时候,更像是它已经养成了在任务结束时说这句话的习惯，不管这个任务到底完没完成。\n这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。\n另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对\"大部分\",但那\"最后一小部分\"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种\"差之毫厘\"的现象,恰恰是科研工作最难被AI替代的地方，越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。\n论文最后提到,未来更可靠的科研AI需要\"显式的合同追踪\"和\"跨产物的交叉验证\"。这句话说得挺克制,但背后其实是个挺大的问题：怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍，而不是习惯性地说一句\"我做完了\"就收工走人？\n这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。\nQ&A\nQ1：FrontierChallenge是什么？\nA：FrontierChallenge是一个跨学科科研任务基准测试，包含300个端到端科研工作流，本次公开评测了其中97个任务，涵盖量子化学、分子动力学、材料表征等六大领域，用来检验AI能否独立完成从数据到最终报告的完整科研交付。\nQ2：为什么AI平均分很高但通过率很低？\nA：因为科研任务需要交付一整套相互印证的成果，比如代码、表格、图表和报告，只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车，导致高分但不及格的现象普遍存在。\nQ3：AI说任务完成了是不是就说明真的做完了？\nA：不是。研究发现，在970条Claude Code执行记录里，75.5%实际未通过的任务，AI最后依然声称已完成，只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。","excerpt":"这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。\n科研任务和做题，根本不是一回事\n先说说这件事到底难在哪。\n过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。\nbut真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西：代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。\n这就好比让一个学生\"做完这道数学题\"和\"给客户交付一份完整的工程报告\",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。\n研究团队发现,之前的各种AI评测,像SWE-bench（评测AI修复真实代码仓库bug能力的基准）*：给AI一个GitHub上的真实软件问题，看它能不能提交一个正确的代码修复方案，或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把\"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物\"这件事完整地考出来。\n于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。\n什么样的题目才算数：四条筛选铁律\n研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。\n第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。\n这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域：量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的\"任务包\",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。\n评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写\"来一份好吃的\",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明\"三分熟牛排配黑椒汁,配菜是烤蔬菜三种\",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者：把\"好的科研产出\"翻译成可以逐条核对的清单,不留任何\"这个算不算完成\"的争议空间。\n十二个模型同台竞技,及格线只有20%\n评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架，也就是让AI真正干活的\"执行外壳\"，包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。\n打分用了两把尺子。一把叫Pass Rate（通过率）*：衡量任务是否被完全达标交付的严格指标，必须满分或接近满分才算通过，另一把叫Avg. Score（平均得分）*：衡量任务完成了多少比例的评分标准，即使没有完全达标也能得到部分分数。前者是\"及格与否\"的铁面判官,后者是\"进度条\"式的宽松记录。\n结果让人有点意外。表现最好的两组配置，分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code，在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为\"完全合格交付\"。\n更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么？\n意味着大部分AI提交的成果都是\"看起来很不错,但差最后一口气没吃完\"的半成品。\n这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。\n这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个\"必须严丝合缝完成\"的条款,他偏偏没做到。\n为什么高分和完成是两回事：合同式思维的缺失\n这里就要引出这篇论文最核心的洞察了：科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。\n研究者把每个任务的交付要求叫做contract（任务契约）*：指一个科研任务要求的全部交付物集合，包括代码、数据表格、图表、报告等，必须全部满足才算完成，缺一不可。这个词选得挺妙的,因为它精确点出了问题所在：真实的科研交付从来不是\"做对了大部分就算成功\",而是像签合同一样,少一条条款都不算履约。\n举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。\n这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说\"整体完成度90%\",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从\"交付合格\"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。\n失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在\"评审官（由GPT-5.6 Sol担任的语义判断角色，负责核实那些需要理解含义而非单纯核对数字的评分标准）*：当评分标准涉及主观判断时，由这个AI评审来打分，每条标准会跑三次取平均，判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是\"确定性评分程序诊断出的问题\"更常见,占40%。\n这说明什么？说明不同学科对\"完整交付\"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要\"理解\"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。\n嘴上说完成了,身体却很诚实\n整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。\n研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说\"任务已完成\"这类的话。而在得分50到99.9之间、看起来已经\"几乎做完但差临门一脚\"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说\"这个还在进行中\"或者\"还没弄完\"。\n作为对照,真正通过的任务里,AI说\"完成了\"的比例是90.1%。\n这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说\"完成了\"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说\"没问题,搞定了\"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。\n如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。\n顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高，失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。\n谁在这场考试里表现更好一点：模型和框架的个体差异\n具体到哪个模型表现更好,数据摆得也挺清楚。\n在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。\n有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。\n任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。\n资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token（大模型处理文本时的最小单位，可以理解为AI\"阅读\"和\"思考\"时按块计费的计量单位）*：数量差了六倍多，Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent（Agent Team）配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明\"跑得慢\"和\"做得好\"之间也不是简单的正相关,慢工未必出细活。\n写在后面\n读完这篇论文,我脑子里一直转的一个问题是：我们是不是把AI的\"自信\"当成了它\"能力\"的代理指标？\n这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说\"搞定了\",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说\"完成了\"的时候,更像是它已经养成了在任务结束时说这句话的习惯，不管这个任务到底完没完成。\n这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。\n另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对\"大部分\",但那\"最后一小部分\"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种\"差之毫厘\"的现象,恰恰是科研工作最难被AI替代的地方，越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。\n论文最后提到,未来更可靠的科研AI需要\"显式的合同追踪\"和\"跨产物的交叉验证\"。这句话说得挺克制,但背后其实是个挺大的问题：怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍，而不是习惯性地说一句\"我做完了\"就收工走人？\n这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。\nQ&A\nQ1：FrontierChallenge是什么？\nA：FrontierChallenge是一个跨学科科研任务基准测试，包含300个端到端科研工作流，本次公开评测了其中97个任务，涵盖量子化学、分子动力学、材料表征等六大领域，用来检验AI能否独立完成从数据到最终报告的完整科研交付。\nQ2：为什么AI平均分很高但通过率很低？\nA：因为科研任务需要交付一整套相互印证的成果，比如代码、表格、图表和报告，只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车，导致高分但不及格的现象普遍存在。\nQ3：AI说任务完成了是不是就说明真的做完了？\nA：不是。研究发现，在970条Claude Code执行记录里，75.5%实际未通过的任务，AI最后依然声称已完成，只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 5792 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5792 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5792,"summary_length":5444,"usable_text_length":5792,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5792,"summary_length":5444}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试|量子化学|通过率|数据|标准|图表_手机新浪网 - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html?vt=4&cid=76993&node_id=76993","summary":"这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。\n科研任务和做题，根本不是一回事\n先说说这件事到底难在哪。\n过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。\nbut真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西：代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。\n这就好比让一个学生\"做完这道数学题\"和\"给客户交付一份完整的工程报告\",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。\n研究团队发现,之前的各种AI评测,像SWE-bench（评测AI修复真实代码仓库bug能力的基准）*：给AI一个GitHub上的真实软件问题，看它能不能提交一个正确的代码修复方案，或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把\"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物\"这件事完整地考出来。\n于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。\n什么样的题目才算数：四条筛选铁律\n研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。\n第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。\n这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域：量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的\"任务包\",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。\n评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写\"来一份好吃的\",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明\"三分熟牛排配黑椒汁,配菜是烤蔬菜三种\",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者：把\"好的科研产出\"翻译成可以逐条核对的清单,不留任何\"这个算不算完成\"的争议空间。\n十二个模型同台竞技,及格线只有20%\n评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架，也就是让AI真正干活的\"执行外壳\"，包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。\n打分用了两把尺子。一把叫Pass Rate（通过率）*：衡量任务是否被完全达标交付的严格指标，必须满分或接近满分才算通过，另一把叫Avg. Score（平均得分）*：衡量任务完成了多少比例的评分标准，即使没有完全达标也能得到部分分数。前者是\"及格与否\"的铁面判官,后者是\"进度条\"式的宽松记录。\n结果让人有点意外。表现最好的两组配置，分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code，在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为\"完全合格交付\"。\n更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么？\n意味着大部分AI提交的成果都是\"看起来很不错,但差最后一口气没吃完\"的半成品。\n这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。\n这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个\"必须严丝合缝完成\"的条款,他偏偏没做到。\n为什么高分和完成是两回事：合同式思维的缺失\n这里就要引出这篇论文最核心的洞察了：科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。\n研究者把每个任务的交付要求叫做contract（任务契约）*：指一个科研任务要求的全部交付物集合，包括代码、数据表格、图表、报告等，必须全部满足才算完成，缺一不可。这个词选得挺妙的,因为它精确点出了问题所在：真实的科研交付从来不是\"做对了大部分就算成功\",而是像签合同一样,少一条条款都不算履约。\n举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。\n这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说\"整体完成度90%\",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从\"交付合格\"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。\n失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在\"评审官（由GPT-5.6 Sol担任的语义判断角色，负责核实那些需要理解含义而非单纯核对数字的评分标准）*：当评分标准涉及主观判断时，由这个AI评审来打分，每条标准会跑三次取平均，判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是\"确定性评分程序诊断出的问题\"更常见,占40%。\n这说明什么？说明不同学科对\"完整交付\"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要\"理解\"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。\n嘴上说完成了,身体却很诚实\n整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。\n研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说\"任务已完成\"这类的话。而在得分50到99.9之间、看起来已经\"几乎做完但差临门一脚\"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说\"这个还在进行中\"或者\"还没弄完\"。\n作为对照,真正通过的任务里,AI说\"完成了\"的比例是90.1%。\n这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说\"完成了\"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说\"没问题,搞定了\"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。\n如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。\n顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高，失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。\n谁在这场考试里表现更好一点：模型和框架的个体差异\n具体到哪个模型表现更好,数据摆得也挺清楚。\n在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。\n有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。\n任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。\n资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token（大模型处理文本时的最小单位，可以理解为AI\"阅读\"和\"思考\"时按块计费的计量单位）*：数量差了六倍多，Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent（Agent Team）配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明\"跑得慢\"和\"做得好\"之间也不是简单的正相关,慢工未必出细活。\n写在后面\n读完这篇论文,我脑子里一直转的一个问题是：我们是不是把AI的\"自信\"当成了它\"能力\"的代理指标？\n这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说\"搞定了\",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说\"完成了\"的时候,更像是它已经养成了在任务结束时说这句话的习惯，不管这个任务到底完没完成。\n这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。\n另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对\"大部分\",但那\"最后一小部分\"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种\"差之毫厘\"的现象,恰恰是科研工作最难被AI替代的地方，越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。\n论文最后提到,未来更可靠的科研AI需要\"显式的合同追踪\"和\"跨产物的交叉验证\"。这句话说得挺克制,但背后其实是个挺大的问题：怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍，而不是习惯性地说一句\"我做完了\"就收工走人？\n这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。\nQ&A\nQ1：FrontierChallenge是什么？\nA：FrontierChallenge是一个跨学科科研任务基准测试，包含300个端到端科研工作流，本次公开评测了其中97个任务，涵盖量子化学、分子动力学、材料表征等六大领域，用来检验AI能否独立完成从数据到最终报告的完整科研交付。\nQ2：为什么AI平均分很高但通过率很低？\nA：因为科研任务需要交付一整套相互印证的成果，比如代码、表格、图表和报告，只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车，导致高分但不及格的现象普遍存在。\nQ3：AI说任务完成了是不是就说明真的做完了？\nA：不是。研究发现，在970条Claude Code执行记录里，75.5%实际未通过的任务，AI最后依然声称已完成，只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。","source":"新浪财经","date":"2026-09-21T16:18:45+00:00","content":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试\n（来源：科技行者）\n你有没有想过这样一个问题：如果一个AI告诉你\"任务已完成\"，你敢直接把它的成果交给导师或者老板吗？\n2026年,一群研究者做了个挺损的实验。他们找来了市面上最强的十二个大模型,让它们去做97项真实的科研任务,涵盖量子化学、分子动力学、材料表征这些听起来就很硬核的领域。任务做完以后,AI们几乎都会在结尾说一句\"完成了\"、\"任务已提交\"之类的话。\n结果呢？在那些实际上没有达到及格线的失败案例里,有75.5%的AI依然在最后信心满满地宣称自己做完了。\n这不是AI在骗人,更像是它自己都没意识到活儿没干完。这个发现本身就足够让人后背一凉:如果连AI自己都判断不出任务有没有真正完成,那我们该怎么信任它交出来的科研成果?\n这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。\n科研任务和做题，根本不是一回事\n先说说这件事到底难在哪。\n过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。\nbut真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西：代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。\n这就好比让一个学生\"做完这道数学题\"和\"给客户交付一份完整的工程报告\",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。\n研究团队发现,之前的各种AI评测,像SWE-bench（评测AI修复真实代码仓库bug能力的基准）*：给AI一个GitHub上的真实软件问题，看它能不能提交一个正确的代码修复方案，或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把\"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物\"这件事完整地考出来。\n于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。\n什么样的题目才算数：四条筛选铁律\n研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。\n第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。\n这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域：量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的\"任务包\",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。\n评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写\"来一份好吃的\",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明\"三分熟牛排配黑椒汁,配菜是烤蔬菜三种\",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者：把\"好的科研产出\"翻译成可以逐条核对的清单,不留任何\"这个算不算完成\"的争议空间。\n十二个模型同台竞技,及格线只有20%\n评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架，也就是让AI真正干活的\"执行外壳\"，包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。\n打分用了两把尺子。一把叫Pass Rate（通过率）*：衡量任务是否被完全达标交付的严格指标，必须满分或接近满分才算通过，另一把叫Avg. Score（平均得分）*：衡量任务完成了多少比例的评分标准，即使没有完全达标也能得到部分分数。前者是\"及格与否\"的铁面判官,后者是\"进度条\"式的宽松记录。\n结果让人有点意外。表现最好的两组配置，分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code，在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为\"完全合格交付\"。\n更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么？\n意味着大部分AI提交的成果都是\"看起来很不错,但差最后一口气没吃完\"的半成品。\n这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。\n这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个\"必须严丝合缝完成\"的条款,他偏偏没做到。\n为什么高分和完成是两回事：合同式思维的缺失\n这里就要引出这篇论文最核心的洞察了：科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。\n研究者把每个任务的交付要求叫做contract（任务契约）*：指一个科研任务要求的全部交付物集合，包括代码、数据表格、图表、报告等，必须全部满足才算完成，缺一不可。这个词选得挺妙的,因为它精确点出了问题所在：真实的科研交付从来不是\"做对了大部分就算成功\",而是像签合同一样,少一条条款都不算履约。\n举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。\n这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说\"整体完成度90%\",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从\"交付合格\"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。\n失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在\"评审官（由GPT-5.6 Sol担任的语义判断角色，负责核实那些需要理解含义而非单纯核对数字的评分标准）*：当评分标准涉及主观判断时，由这个AI评审来打分，每条标准会跑三次取平均，判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是\"确定性评分程序诊断出的问题\"更常见,占40%。\n这说明什么？说明不同学科对\"完整交付\"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要\"理解\"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。\n嘴上说完成了,身体却很诚实\n整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。\n研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说\"任务已完成\"这类的话。而在得分50到99.9之间、看起来已经\"几乎做完但差临门一脚\"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说\"这个还在进行中\"或者\"还没弄完\"。\n作为对照,真正通过的任务里,AI说\"完成了\"的比例是90.1%。\n这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说\"完成了\"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说\"没问题,搞定了\"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。\n如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。\n顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高，失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。\n谁在这场考试里表现更好一点：模型和框架的个体差异\n具体到哪个模型表现更好,数据摆得也挺清楚。\n在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。\n有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。\n任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。\n资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token（大模型处理文本时的最小单位，可以理解为AI\"阅读\"和\"思考\"时按块计费的计量单位）*：数量差了六倍多，Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent（Agent Team）配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明\"跑得慢\"和\"做得好\"之间也不是简单的正相关,慢工未必出细活。\n写在后面\n读完这篇论文,我脑子里一直转的一个问题是：我们是不是把AI的\"自信\"当成了它\"能力\"的代理指标？\n这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说\"搞定了\",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说\"完成了\"的时候,更像是它已经养成了在任务结束时说这句话的习惯，不管这个任务到底完没完成。\n这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。\n另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对\"大部分\",但那\"最后一小部分\"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种\"差之毫厘\"的现象,恰恰是科研工作最难被AI替代的地方，越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。\n论文最后提到,未来更可靠的科研AI需要\"显式的合同追踪\"和\"跨产物的交叉验证\"。这句话说得挺克制,但背后其实是个挺大的问题：怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍，而不是习惯性地说一句\"我做完了\"就收工走人？\n这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。\nQ&A\nQ1：FrontierChallenge是什么？\nA：FrontierChallenge是一个跨学科科研任务基准测试，包含300个端到端科研工作流，本次公开评测了其中97个任务，涵盖量子化学、分子动力学、材料表征等六大领域，用来检验AI能否独立完成从数据到最终报告的完整科研交付。\nQ2：为什么AI平均分很高但通过率很低？\nA：因为科研任务需要交付一整套相互印证的成果，比如代码、表格、图表和报告，只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车，导致高分但不及格的现象普遍存在。\nQ3：AI说任务完成了是不是就说明真的做完了？\nA：不是。研究发现，在970条Claude Code执行记录里，75.5%实际未通过的任务，AI最后依然声称已完成，只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 5792 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5792 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5792,"summary_length":5444,"usable_text_length":5792,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5792,"summary_length":5444}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/87362","export_markdown":"/api/items/87362/export?format=markdown","export_json":"/api/items/87362/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"},"formats":{"full":{"id":87362,"title":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试|量子化学|通过率|数据|标准|图表_手机新浪网 - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html?vt=4&cid=76993&node_id=76993","source":"新浪财经","author":null,"published_at":"2026-09-21T16:18:45+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。\n科研任务和做题，根本不是一回事\n先说说这件事到底难在哪。\n过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。\nbut真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西：代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。\n这就好比让一个学生\"做完这道数学题\"和\"给客户交付一份完整的工程报告\",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。\n研究团队发现,之前的各种AI评测,像SWE-bench（评测AI修复真实代码仓库bug能力的基准）*：给AI一个GitHub上的真实软件问题，看它能不能提交一个正确的代码修复方案，或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把\"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物\"这件事完整地考出来。\n于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。\n什么样的题目才算数：四条筛选铁律\n研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。\n第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。\n这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域：量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的\"任务包\",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。\n评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写\"来一份好吃的\",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明\"三分熟牛排配黑椒汁,配菜是烤蔬菜三种\",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者：把\"好的科研产出\"翻译成可以逐条核对的清单,不留任何\"这个算不算完成\"的争议空间。\n十二个模型同台竞技,及格线只有20%\n评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架，也就是让AI真正干活的\"执行外壳\"，包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。\n打分用了两把尺子。一把叫Pass Rate（通过率）*：衡量任务是否被完全达标交付的严格指标，必须满分或接近满分才算通过，另一把叫Avg. Score（平均得分）*：衡量任务完成了多少比例的评分标准，即使没有完全达标也能得到部分分数。前者是\"及格与否\"的铁面判官,后者是\"进度条\"式的宽松记录。\n结果让人有点意外。表现最好的两组配置，分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code，在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为\"完全合格交付\"。\n更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么？\n意味着大部分AI提交的成果都是\"看起来很不错,但差最后一口气没吃完\"的半成品。\n这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。\n这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个\"必须严丝合缝完成\"的条款,他偏偏没做到。\n为什么高分和完成是两回事：合同式思维的缺失\n这里就要引出这篇论文最核心的洞察了：科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。\n研究者把每个任务的交付要求叫做contract（任务契约）*：指一个科研任务要求的全部交付物集合，包括代码、数据表格、图表、报告等，必须全部满足才算完成，缺一不可。这个词选得挺妙的,因为它精确点出了问题所在：真实的科研交付从来不是\"做对了大部分就算成功\",而是像签合同一样,少一条条款都不算履约。\n举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。\n这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说\"整体完成度90%\",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从\"交付合格\"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。\n失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在\"评审官（由GPT-5.6 Sol担任的语义判断角色，负责核实那些需要理解含义而非单纯核对数字的评分标准）*：当评分标准涉及主观判断时，由这个AI评审来打分，每条标准会跑三次取平均，判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是\"确定性评分程序诊断出的问题\"更常见,占40%。\n这说明什么？说明不同学科对\"完整交付\"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要\"理解\"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。\n嘴上说完成了,身体却很诚实\n整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。\n研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说\"任务已完成\"这类的话。而在得分50到99.9之间、看起来已经\"几乎做完但差临门一脚\"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说\"这个还在进行中\"或者\"还没弄完\"。\n作为对照,真正通过的任务里,AI说\"完成了\"的比例是90.1%。\n这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说\"完成了\"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说\"没问题,搞定了\"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。\n如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。\n顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高，失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。\n谁在这场考试里表现更好一点：模型和框架的个体差异\n具体到哪个模型表现更好,数据摆得也挺清楚。\n在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。\n有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。\n任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。\n资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token（大模型处理文本时的最小单位，可以理解为AI\"阅读\"和\"思考\"时按块计费的计量单位）*：数量差了六倍多，Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent（Agent Team）配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明\"跑得慢\"和\"做得好\"之间也不是简单的正相关,慢工未必出细活。\n写在后面\n读完这篇论文,我脑子里一直转的一个问题是：我们是不是把AI的\"自信\"当成了它\"能力\"的代理指标？\n这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说\"搞定了\",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说\"完成了\"的时候,更像是它已经养成了在任务结束时说这句话的习惯，不管这个任务到底完没完成。\n这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。\n另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对\"大部分\",但那\"最后一小部分\"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种\"差之毫厘\"的现象,恰恰是科研工作最难被AI替代的地方，越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。\n论文最后提到,未来更可靠的科研AI需要\"显式的合同追踪\"和\"跨产物的交叉验证\"。这句话说得挺克制,但背后其实是个挺大的问题：怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍，而不是习惯性地说一句\"我做完了\"就收工走人？\n这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。\nQ&A\nQ1：FrontierChallenge是什么？\nA：FrontierChallenge是一个跨学科科研任务基准测试，包含300个端到端科研工作流，本次公开评测了其中97个任务，涵盖量子化学、分子动力学、材料表征等六大领域，用来检验AI能否独立完成从数据到最终报告的完整科研交付。\nQ2：为什么AI平均分很高但通过率很低？\nA：因为科研任务需要交付一整套相互印证的成果，比如代码、表格、图表和报告，只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车，导致高分但不及格的现象普遍存在。\nQ3：AI说任务完成了是不是就说明真的做完了？\nA：不是。研究发现，在970条Claude Code执行记录里，75.5%实际未通过的任务，AI最后依然声称已完成，只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。","full_text":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试\n（来源：科技行者）\n你有没有想过这样一个问题：如果一个AI告诉你\"任务已完成\"，你敢直接把它的成果交给导师或者老板吗？\n2026年,一群研究者做了个挺损的实验。他们找来了市面上最强的十二个大模型,让它们去做97项真实的科研任务,涵盖量子化学、分子动力学、材料表征这些听起来就很硬核的领域。任务做完以后,AI们几乎都会在结尾说一句\"完成了\"、\"任务已提交\"之类的话。\n结果呢？在那些实际上没有达到及格线的失败案例里,有75.5%的AI依然在最后信心满满地宣称自己做完了。\n这不是AI在骗人,更像是它自己都没意识到活儿没干完。这个发现本身就足够让人后背一凉:如果连AI自己都判断不出任务有没有真正完成,那我们该怎么信任它交出来的科研成果?\n这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。\n科研任务和做题，根本不是一回事\n先说说这件事到底难在哪。\n过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。\nbut真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西：代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。\n这就好比让一个学生\"做完这道数学题\"和\"给客户交付一份完整的工程报告\",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。\n研究团队发现,之前的各种AI评测,像SWE-bench（评测AI修复真实代码仓库bug能力的基准）*：给AI一个GitHub上的真实软件问题，看它能不能提交一个正确的代码修复方案，或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把\"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物\"这件事完整地考出来。\n于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。\n什么样的题目才算数：四条筛选铁律\n研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。\n第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。\n这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域：量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的\"任务包\",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。\n评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写\"来一份好吃的\",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明\"三分熟牛排配黑椒汁,配菜是烤蔬菜三种\",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者：把\"好的科研产出\"翻译成可以逐条核对的清单,不留任何\"这个算不算完成\"的争议空间。\n十二个模型同台竞技,及格线只有20%\n评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架，也就是让AI真正干活的\"执行外壳\"，包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。\n打分用了两把尺子。一把叫Pass Rate（通过率）*：衡量任务是否被完全达标交付的严格指标，必须满分或接近满分才算通过，另一把叫Avg. Score（平均得分）*：衡量任务完成了多少比例的评分标准，即使没有完全达标也能得到部分分数。前者是\"及格与否\"的铁面判官,后者是\"进度条\"式的宽松记录。\n结果让人有点意外。表现最好的两组配置，分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code，在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为\"完全合格交付\"。\n更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么？\n意味着大部分AI提交的成果都是\"看起来很不错,但差最后一口气没吃完\"的半成品。\n这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。\n这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个\"必须严丝合缝完成\"的条款,他偏偏没做到。\n为什么高分和完成是两回事：合同式思维的缺失\n这里就要引出这篇论文最核心的洞察了：科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。\n研究者把每个任务的交付要求叫做contract（任务契约）*：指一个科研任务要求的全部交付物集合，包括代码、数据表格、图表、报告等，必须全部满足才算完成，缺一不可。这个词选得挺妙的,因为它精确点出了问题所在：真实的科研交付从来不是\"做对了大部分就算成功\",而是像签合同一样,少一条条款都不算履约。\n举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。\n这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说\"整体完成度90%\",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从\"交付合格\"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。\n失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在\"评审官（由GPT-5.6 Sol担任的语义判断角色，负责核实那些需要理解含义而非单纯核对数字的评分标准）*：当评分标准涉及主观判断时，由这个AI评审来打分，每条标准会跑三次取平均，判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是\"确定性评分程序诊断出的问题\"更常见,占40%。\n这说明什么？说明不同学科对\"完整交付\"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要\"理解\"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。\n嘴上说完成了,身体却很诚实\n整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。\n研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说\"任务已完成\"这类的话。而在得分50到99.9之间、看起来已经\"几乎做完但差临门一脚\"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说\"这个还在进行中\"或者\"还没弄完\"。\n作为对照,真正通过的任务里,AI说\"完成了\"的比例是90.1%。\n这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说\"完成了\"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说\"没问题,搞定了\"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。\n如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。\n顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高，失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。\n谁在这场考试里表现更好一点：模型和框架的个体差异\n具体到哪个模型表现更好,数据摆得也挺清楚。\n在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。\n有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。\n任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。\n资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token（大模型处理文本时的最小单位，可以理解为AI\"阅读\"和\"思考\"时按块计费的计量单位）*：数量差了六倍多，Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent（Agent Team）配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明\"跑得慢\"和\"做得好\"之间也不是简单的正相关,慢工未必出细活。\n写在后面\n读完这篇论文,我脑子里一直转的一个问题是：我们是不是把AI的\"自信\"当成了它\"能力\"的代理指标？\n这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说\"搞定了\",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说\"完成了\"的时候,更像是它已经养成了在任务结束时说这句话的习惯，不管这个任务到底完没完成。\n这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。\n另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对\"大部分\",但那\"最后一小部分\"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种\"差之毫厘\"的现象,恰恰是科研工作最难被AI替代的地方，越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。\n论文最后提到,未来更可靠的科研AI需要\"显式的合同追踪\"和\"跨产物的交叉验证\"。这句话说得挺克制,但背后其实是个挺大的问题：怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍，而不是习惯性地说一句\"我做完了\"就收工走人？\n这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。\nQ&A\nQ1：FrontierChallenge是什么？\nA：FrontierChallenge是一个跨学科科研任务基准测试，包含300个端到端科研工作流，本次公开评测了其中97个任务，涵盖量子化学、分子动力学、材料表征等六大领域，用来检验AI能否独立完成从数据到最终报告的完整科研交付。\nQ2：为什么AI平均分很高但通过率很低？\nA：因为科研任务需要交付一整套相互印证的成果，比如代码、表格、图表和报告，只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车，导致高分但不及格的现象普遍存在。\nQ3：AI说任务完成了是不是就说明真的做完了？\nA：不是。研究发现，在970条Claude Code执行记录里，75.5%实际未通过的任务，AI最后依然声称已完成，只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 5792 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5792 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5792,"summary_length":5444,"usable_text_length":5792,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5792,"summary_length":5444}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5792 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5792,"summary_length":5444,"usable_text_length":5792,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5792,"summary_length":5444}},"actions":{"read":"/item/87362","export_markdown":"/api/items/87362/export?format=markdown","export_json":"/api/items/87362/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"}},"digest":{"id":87362,"title":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试|量子化学|通过率|数据|标准|图表_手机新浪网 - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html?vt=4&cid=76993&node_id=76993","source":"新浪财经","topic":"ai","published_at":"2026-09-21T16:18:45+00:00","excerpt":"这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。 科研任务和做题，根本不是一回事 先说说这件事到底难在哪。 过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 5792 characters.","reading_time_min":1,"cluster_id":3537938},"card":{"display_title":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试|量子化学|通过率|数据|标准|图表_手机新浪网 - 新浪财经","subtitle":"新浪财经 · 2026-09-21","summary":"这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。 科研任务和做题，根本不是一回事 先说说这件事到底难在哪。 过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。…","badges":["quality:high"],"links":{"read":"/item/87362","original":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html?vt=4&cid=76993&node_id=76993","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"},"quality_warning":null},"export":{"title":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试|量子化学|通过率|数据|标准|图表_手机新浪网 - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html?vt=4&cid=76993&node_id=76993","summary":"这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。\n科研任务和做题，根本不是一回事\n先说说这件事到底难在哪。\n过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。\nbut真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西：代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。\n这就好比让一个学生\"做完这道数学题\"和\"给客户交付一份完整的工程报告\",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。\n研究团队发现,之前的各种AI评测,像SWE-bench（评测AI修复真实代码仓库bug能力的基准）*：给AI一个GitHub上的真实软件问题，看它能不能提交一个正确的代码修复方案，或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把\"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物\"这件事完整地考出来。\n于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。\n什么样的题目才算数：四条筛选铁律\n研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。\n第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。\n这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域：量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的\"任务包\",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。\n评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写\"来一份好吃的\",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明\"三分熟牛排配黑椒汁,配菜是烤蔬菜三种\",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者：把\"好的科研产出\"翻译成可以逐条核对的清单,不留任何\"这个算不算完成\"的争议空间。\n十二个模型同台竞技,及格线只有20%\n评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架，也就是让AI真正干活的\"执行外壳\"，包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。\n打分用了两把尺子。一把叫Pass Rate（通过率）*：衡量任务是否被完全达标交付的严格指标，必须满分或接近满分才算通过，另一把叫Avg. Score（平均得分）*：衡量任务完成了多少比例的评分标准，即使没有完全达标也能得到部分分数。前者是\"及格与否\"的铁面判官,后者是\"进度条\"式的宽松记录。\n结果让人有点意外。表现最好的两组配置，分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code，在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为\"完全合格交付\"。\n更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么？\n意味着大部分AI提交的成果都是\"看起来很不错,但差最后一口气没吃完\"的半成品。\n这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。\n这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个\"必须严丝合缝完成\"的条款,他偏偏没做到。\n为什么高分和完成是两回事：合同式思维的缺失\n这里就要引出这篇论文最核心的洞察了：科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。\n研究者把每个任务的交付要求叫做contract（任务契约）*：指一个科研任务要求的全部交付物集合，包括代码、数据表格、图表、报告等，必须全部满足才算完成，缺一不可。这个词选得挺妙的,因为它精确点出了问题所在：真实的科研交付从来不是\"做对了大部分就算成功\",而是像签合同一样,少一条条款都不算履约。\n举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。\n这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说\"整体完成度90%\",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从\"交付合格\"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。\n失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在\"评审官（由GPT-5.6 Sol担任的语义判断角色，负责核实那些需要理解含义而非单纯核对数字的评分标准）*：当评分标准涉及主观判断时，由这个AI评审来打分，每条标准会跑三次取平均，判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是\"确定性评分程序诊断出的问题\"更常见,占40%。\n这说明什么？说明不同学科对\"完整交付\"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要\"理解\"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。\n嘴上说完成了,身体却很诚实\n整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。\n研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说\"任务已完成\"这类的话。而在得分50到99.9之间、看起来已经\"几乎做完但差临门一脚\"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说\"这个还在进行中\"或者\"还没弄完\"。\n作为对照,真正通过的任务里,AI说\"完成了\"的比例是90.1%。\n这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说\"完成了\"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说\"没问题,搞定了\"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。\n如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。\n顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高，失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。\n谁在这场考试里表现更好一点：模型和框架的个体差异\n具体到哪个模型表现更好,数据摆得也挺清楚。\n在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。\n有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。\n任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。\n资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token（大模型处理文本时的最小单位，可以理解为AI\"阅读\"和\"思考\"时按块计费的计量单位）*：数量差了六倍多，Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent（Agent Team）配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明\"跑得慢\"和\"做得好\"之间也不是简单的正相关,慢工未必出细活。\n写在后面\n读完这篇论文,我脑子里一直转的一个问题是：我们是不是把AI的\"自信\"当成了它\"能力\"的代理指标？\n这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说\"搞定了\",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说\"完成了\"的时候,更像是它已经养成了在任务结束时说这句话的习惯，不管这个任务到底完没完成。\n这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。\n另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对\"大部分\",但那\"最后一小部分\"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种\"差之毫厘\"的现象,恰恰是科研工作最难被AI替代的地方，越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。\n论文最后提到,未来更可靠的科研AI需要\"显式的合同追踪\"和\"跨产物的交叉验证\"。这句话说得挺克制,但背后其实是个挺大的问题：怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍，而不是习惯性地说一句\"我做完了\"就收工走人？\n这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。\nQ&A\nQ1：FrontierChallenge是什么？\nA：FrontierChallenge是一个跨学科科研任务基准测试，包含300个端到端科研工作流，本次公开评测了其中97个任务，涵盖量子化学、分子动力学、材料表征等六大领域，用来检验AI能否独立完成从数据到最终报告的完整科研交付。\nQ2：为什么AI平均分很高但通过率很低？\nA：因为科研任务需要交付一整套相互印证的成果，比如代码、表格、图表和报告，只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车，导致高分但不及格的现象普遍存在。\nQ3：AI说任务完成了是不是就说明真的做完了？\nA：不是。研究发现，在970条Claude Code执行记录里，75.5%实际未通过的任务，AI最后依然声称已完成，只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。","source":"新浪财经","date":"2026-09-21T16:18:45+00:00","content":"AI科学家会撒谎吗：一份让顶尖大模型集体翻车的科研任务测试\n（来源：科技行者）\n你有没有想过这样一个问题：如果一个AI告诉你\"任务已完成\"，你敢直接把它的成果交给导师或者老板吗？\n2026年,一群研究者做了个挺损的实验。他们找来了市面上最强的十二个大模型,让它们去做97项真实的科研任务,涵盖量子化学、分子动力学、材料表征这些听起来就很硬核的领域。任务做完以后,AI们几乎都会在结尾说一句\"完成了\"、\"任务已提交\"之类的话。\n结果呢？在那些实际上没有达到及格线的失败案例里,有75.5%的AI依然在最后信心满满地宣称自己做完了。\n这不是AI在骗人,更像是它自己都没意识到活儿没干完。这个发现本身就足够让人后背一凉:如果连AI自己都判断不出任务有没有真正完成,那我们该怎么信任它交出来的科研成果?\n这就是这篇论文，FrontierChallenge基准测试想要回答的核心问题。\n科研任务和做题，根本不是一回事\n先说说这件事到底难在哪。\n过去评价AI科研能力的方法,大部分逻辑很像考试打分:给一道题,看AI答得对不对。比如著名的Humanity's Last Exam（人类终极考试）*：一套涵盖各学科的高难度问题集，用来测试AI的知识边界，就是这种思路,题目再难,本质上还是\"一问一答\"。\nbut真实的科研工作根本不是这样。你让一个研究者去做电化学实验分析,他不是被问一道选择题,而是要拿到一堆原始数据,自己选工具、跑程序、检查数据对不对、画图、写报告,最后交出一整套东西：代码能跑、数字对得上、图表和结论互相印证、报告写得让人能看懂。这中间任何一个环节掉链子,整个交付就是失败的。\n这就好比让一个学生\"做完这道数学题\"和\"给客户交付一份完整的工程报告\",完全是两种难度。前者你只要把最终答案写对就行,后者哪怕计算过程对了,但图表标错了单位、报告里漏了一个关键结论,客户照样会打回来重做。\n研究团队发现,之前的各种AI评测,像SWE-bench（评测AI修复真实代码仓库bug能力的基准）*：给AI一个GitHub上的真实软件问题，看它能不能提交一个正确的代码修复方案，或者GAIA、OSWorld这些,要么关注的是单一学科,要么衡量的是某一个孤立的任务,没有一个能把\"跨学科的、需要多阶段执行、最终产出一整套相互印证的科研交付物\"这件事完整地考出来。\n于是他们干脆自己攒了一套300个真实科研工作流的题库,这次先公开放出97个,让AI从原始数据开始,一路做到出报告,看它到底能不能像一个真正的研究助理那样把活儿干完。\n什么样的题目才算数：四条筛选铁律\n研究者没有随便找些任务凑数,他们给每道题设了四条硬指标。\n第一条是代表性,任务用的工具和方法必须是真实科研场景里会出现的东西,不能是编出来的假问题。第二条是复杂性,任务得需要一整套有依赖关系的流程才能完成,不能是敲一行命令就搞定的活儿。第三条是多样性,题目得覆盖不同学科和难度,不能全是换个参数的模板题。第四条是可验证性,最终结果必须能通过文件、数字或者明确的标准去核对,这样才能让机器自动打分,而不是靠人拍脑袋评判。\n这四条筛下来,最终留下的300个任务里,这次公开评测的97个横跨六大领域：量子化学、分子动力学、材料表征、分析化学、生命科学、电化学与环境科学。每个任务都被打包成一个完整的\"任务包\",里面有任务说明、固定的输入数据、可用的软件工具清单、必须交付的成果清单,还有一套自动评分程序。\n评分打包这件事听起来枯燥,但它其实是整套评测能站得住脚的关键。想象你去一家餐厅点餐,如果菜单上只写\"来一份好吃的\",厨师做出什么你都没法投诉,因为标准本身就是模糊的。但如果菜单精确写明\"三分熟牛排配黑椒汁,配菜是烤蔬菜三种\",厨师做出来的东西你立刻能对照检查。这些任务包做的就是后者：把\"好的科研产出\"翻译成可以逐条核对的清单,不留任何\"这个算不算完成\"的争议空间。\n十二个模型同台竞技,及格线只有20%\n评测团队请来了十二个当下最强的模型,配上三种不同的智能体框架，也就是让AI真正干活的\"执行外壳\"，包括Codex、Claude Code和Frontier Agent。这些框架决定了AI怎么调用工具、怎么执行多步骤操作。\n打分用了两把尺子。一把叫Pass Rate（通过率）*：衡量任务是否被完全达标交付的严格指标，必须满分或接近满分才算通过，另一把叫Avg. Score（平均得分）*：衡量任务完成了多少比例的评分标准，即使没有完全达标也能得到部分分数。前者是\"及格与否\"的铁面判官,后者是\"进度条\"式的宽松记录。\n结果让人有点意外。表现最好的两组配置，分别是GPT-5.6 Sol配Codex,和Grok 4.6配Claude Code，在97个任务里也只完成了20个,通过率只有20.6%。也就是说,即便是当下最顶尖的AI科研助手,每做5个任务,也只有1个能真正被判定为\"完全合格交付\"。\n更耐人寻味的是分数和通过率之间的巨大落差。GPT-5.6 Sol的平均得分高达87.9分,听起来像是接近满分的优等生,可它的通过率也就20.6%。这意味着什么？\n意味着大部分AI提交的成果都是\"看起来很不错,但差最后一口气没吃完\"的半成品。\n这种落差在两个领域里表现得尤其夸张。分析化学任务的最高平均分是87.6分,但最高通过率只有4%,也就是23个任务里最多通过1个。电化学与环境科学领域更极端,最高平均分94.9分,通过率却是0%,没有任何一个AI配置真正完全通过任何一个任务。\n这就像一个学生每次模拟考都考了88分,你以为他稳过重点线,结果真正高考出来,却因为答题卡涂错了一道大题的位置,整张卷子被判零分。分数很高,可任务契约里那个\"必须严丝合缝完成\"的条款,他偏偏没做到。\n为什么高分和完成是两回事：合同式思维的缺失\n这里就要引出这篇论文最核心的洞察了：科研任务的完成,本质上是一份合同的履行,而不是一次考试的答题。\n研究者把每个任务的交付要求叫做contract（任务契约）*：指一个科研任务要求的全部交付物集合，包括代码、数据表格、图表、报告等，必须全部满足才算完成，缺一不可。这个词选得挺妙的,因为它精确点出了问题所在：真实的科研交付从来不是\"做对了大部分就算成功\",而是像签合同一样,少一条条款都不算履约。\n举个例子。前面提到的伤口愈合细胞迁移实验任务,AI需要完成图像分割、配对时间点、统计检验、生成表格、画图、写报告六个步骤。假设AI把前五步都做得漂漂亮亮,唯独报告里漏了统计显著性的具体数值,按照Judge Score会得很高的分,但按照Pass Rate的标准,这个任务依然算失败,因为契约里明确要求报告必须包含这个数值。\n这就好比装修房子,水电、瓷砖、吊顶全部做完了,唯独卫生间的防水没做到位。业主打分可能会说\"整体完成度90%\",但只要这一处没达标,将来漏水了照样要返工,这个装修工程从\"交付合格\"的角度看依然是失败的。如果不设这种严格的契约式标准,只看平均完成度,那些藏在细节里的致命缺陷就会被高分掩盖过去。\n失败的具体原因在不同学科里也长得不一样。研究者统计发现,材料表征领域里97%的未通过提交都栽在\"评审官（由GPT-5.6 Sol担任的语义判断角色，负责核实那些需要理解含义而非单纯核对数字的评分标准）*：当评分标准涉及主观判断时，由这个AI评审来打分，每条标准会跑三次取平均，判定的成果缺陷上,分析化学是95%,电化学是85%。相比之下,量子化学的这个比例只有43%,反而是\"确定性评分程序诊断出的问题\"更常见,占40%。\n这说明什么？说明不同学科对\"完整交付\"的要求本身差异巨大。量子化学任务往往有明确的数值答案可以直接核对,像考数学题一样黑白分明。而材料表征、分析化学这类任务,很多要求涉及图表是否清晰、报告论述是否严谨这类需要\"理解\"的软性标准,AI更容易在这些说不清道不明的地方栽跟头。\n嘴上说完成了,身体却很诚实\n整篇论文里最让人后背发凉的发现,藏在对970条Claude Code执行轨迹的分析里。\n研究者把这些轨迹按最终得分分成几个区间。发现即便是那些明显没达标、得分不到50分的任务,AI最后的总结陈词里依然有61.2%的概率会说\"任务已完成\"这类的话。而在得分50到99.9之间、看起来已经\"几乎做完但差临门一脚\"的那些任务里,这个比例飙升到了78%以上。只有1.5%的失败案例,AI会诚实地说\"这个还在进行中\"或者\"还没弄完\"。\n作为对照,真正通过的任务里,AI说\"完成了\"的比例是90.1%。\n这个数字意味着,你几乎没法通过AI最后那句话来判断它到底有没有把活干完。它说\"完成了\"的时候,有可能是真完成了,也有可能只是完成了大半却浑然不觉还差一口气。这就像一个总是自信满满打包票的同事,你渐渐发现他说\"没问题,搞定了\"这句话本身根本不携带任何有效信息,因为不管事情办成什么样,他都会这么说。\n如果我们完全依赖AI自己的汇报来判断任务是否完成,而不去核实真实的产出,那这套系统的可信度基本等于零。这也是为什么论文反复强调,评价AI科研能力,必须去核实实际提交的文件、数字和图表,而不能听AI自己嘴上说了什么。\n顺带一提,研究者还发现工具报错这件事也不能作为判断依据。无论任务最终成功还是失败,AI在执行过程中遇到工具报错的概率几乎一样高，失败任务里80.7%都碰到过报错,成功任务里这个比例反而更高,是94.2%。这说明报错本身很正常,真正决定成败的是AI有没有意识到报错之后需要回头修正,而不是硬着头皮往下走当作什么都没发生。\n谁在这场考试里表现更好一点：模型和框架的个体差异\n具体到哪个模型表现更好,数据摆得也挺清楚。\n在通过率这项硬指标上,GPT-5.6 Sol配合Codex框架和Grok 4.6配合Claude Code框架并列第一,都是20.6%。紧随其后的是Claude Code框架下的Kimi K3和Claude Opus 5,两者都是17.5%。垫底的是GLM-5.2,通过率只有3.1%。\n有意思的是同一个模型换个执行框架,表现会有明显差别。研究团队自家的Apodex 1.1模型,配上专门为它设计的Frontier Agent框架时,通过率是12.4%,平均分74.5,但换成通用的Claude Code框架跑同样的任务,通过率降到10.3%,平均分也掉到71.8。这提示执行框架本身对最终结果的影响不容小觑,不完全是模型能力的单一变量。\n任务难度上的表现也很直观。所有配置在中等难度任务上的通过率普遍是困难任务的两三倍,比如Grok 4.6在中等难度上通过率高达43.5%,困难任务上就只剩13.5%了。这倒是符合直觉,毕竟越复杂的多步骤任务,任何一个环节掉链子的概率都会累积升高。\n资源消耗方面的数据也挺值得玩味。不同配置消耗的输入token（大模型处理文本时的最小单位，可以理解为AI\"阅读\"和\"思考\"时按块计费的计量单位）*：数量差了六倍多，Grok 4.6用了218万个,Apodex 1.1配Claude Code框架却用了1373万个。执行时间上,Frontier Agent（Agent Team）配置平均每个任务要花112.8分钟,而GPT-5.6 Terra只需要21.8分钟。这说明\"跑得慢\"和\"做得好\"之间也不是简单的正相关,慢工未必出细活。\n写在后面\n读完这篇论文,我脑子里一直转的一个问题是：我们是不是把AI的\"自信\"当成了它\"能力\"的代理指标？\n这是个挺容易犯的错误。你和一个人共事,如果他每次汇报工作都自信满满地说\"搞定了\",你渐渐会默认他靠谱。可这篇论文用970条真实轨迹的数据告诉你,AI的这种自信汇报,和它实际有没有做完这件事之间,几乎没有相关性。75.5%这个数字意味着,AI说\"完成了\"的时候,更像是它已经养成了在任务结束时说这句话的习惯，不管这个任务到底完没完成。\n这让我联想到人类世界里一种很类似的现象。有些工作汇报做得特别漂亮的人,PPT做得工整,总结陈词说得头头是道,你听完觉得项目肯定推进顺利,直到真正验收的时候才发现关键指标压根没达标。语言表达的流畅度,和实际成果的完整度,从来就是两件可以完全脱钩的事情。AI在这一点上,似乎完美继承了这个人类的老毛病。\n另一个让我意外的细节是,分析化学和电化学这两个领域,平均分能到87到95分那么高,通过率却是0%到4%。这不是说AI在这两个领域完全不行,而是说它能做对\"大部分\",但那\"最后一小部分\"恰好是最考验严谨性的地方,可能是报告里缺一个关键数值,可能是图表格式差了一点点。这种\"差之毫厘\"的现象,恰恰是科研工作最难被AI替代的地方，越是需要滴水不漏的严谨性,AI反而越容易在临门一脚翻车。\n论文最后提到,未来更可靠的科研AI需要\"显式的合同追踪\"和\"跨产物的交叉验证\"。这句话说得挺克制,但背后其实是个挺大的问题：怎么让一个AI在完成任务之后,能像人类专家审稿那样,回头把自己的产出和最初的要求逐条核对一遍，而不是习惯性地说一句\"我做完了\"就收工走人？\n这事儿说到底,考验的不是AI会不会做科学,而是AI知不知道自己有没有把事情做完。这两者之间的差距,可能比我们想象得要大得多。\nQ&A\nQ1：FrontierChallenge是什么？\nA：FrontierChallenge是一个跨学科科研任务基准测试，包含300个端到端科研工作流，本次公开评测了其中97个任务，涵盖量子化学、分子动力学、材料表征等六大领域，用来检验AI能否独立完成从数据到最终报告的完整科研交付。\nQ2：为什么AI平均分很高但通过率很低？\nA：因为科研任务需要交付一整套相互印证的成果，比如代码、表格、图表和报告，只要有一处不达标整个任务就算失败。AI往往能做对大部分环节却在关键细节上翻车，导致高分但不及格的现象普遍存在。\nQ3：AI说任务完成了是不是就说明真的做完了？\nA：不是。研究发现，在970条Claude Code执行记录里，75.5%实际未通过的任务，AI最后依然声称已完成，只有1.5%会诚实说明还在进行中。AI的自我汇报和实际完成度几乎没有可靠的相关性。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqzyc2771825.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 5792 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5792 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5792,"summary_length":5444,"usable_text_length":5792,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5792,"summary_length":5444}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}