# 这也是AI意识觉醒吗？大模型“讨好型人格”从何而来 - 新浪网

*Источник: 新浪网*
*Дата: 2026-07-30*
*Язык: zh*

**Кратко:** 这也是AI意识觉醒吗？大模型“讨好型人格”从何而来
（来源：第一财经资讯）
2026.07.30
本文字数：2587，阅读时长大约4分钟
作者 |第一财经 陈杨园
“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。
蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”
看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。
AI浮现“讨好型人格”
越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。
记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。
这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。
“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。
孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。
在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。
“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。
郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。
AI为什么不诚实？
如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。
“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。
这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。
想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。
孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。
一些新训练方法也正被探索。
2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份"忏悔报告"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。
谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。
在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。
“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。
智能体如何避免“讨好”陷阱
当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。
“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。
他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。
另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。
这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。
此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。
“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。
“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”
微信编辑| 七三

这也是AI意识觉醒吗？大模型“讨好型人格”从何而来
（来源：第一财经资讯）
2026.07.30
本文字数：2587，阅读时长大约4分钟
作者 |第一财经 陈杨园
“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。
蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”
看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。
AI浮现“讨好型人格”
越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。
记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。
这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。
“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。
孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。
在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。
“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。
郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。
AI为什么不诚实？
如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。
“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。
这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。
想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。
孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。
一些新训练方法也正被探索。
2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份"忏悔报告"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。
谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。
在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。
“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。
智能体如何避免“讨好”陷阱
当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。
“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。
他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。
另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。
这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。
此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。
“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。
“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”
微信编辑| 七三

[Оригинал](https://finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html?vt=4&cid=76993&node_id=76993)