{"id":49507,"topic":"ai","source":"新浪网","title":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来 - 新浪网","url":"https://finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html?vt=4&cid=76993&node_id=76993","url_hash":"19fb0b11b7ad54a6d6a2f68616b05f20d02845c9","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMipwFBVV95cUxPN295WG1wYVlQTVVyUF9BME1CQXFUdmZPVXNmQVFmbjdRSXV6bDNSd2dqMnZFS2Y1eTZTcERvSGs5SHpIcFhSRXIwRDkwSFNpRG51ekhkb0ZKcEZPVkNtanpaYlhCOS1jYnpnU0NMc1BXVHp3Mi16V3Q0djNSczN5SGttWDJ2amFzU1JDX2ZUMEFCMUtfbzNSS0hoQ3RYYkVPcTJ6S1FLcw?oc=5\" target=\"_blank\">这也是AI意识觉醒吗？大模型“讨好型人格”从何而来</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪网</font>","content":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来\n（来源：第一财经资讯）\n2026.07.30\n本文字数：2587，阅读时长大约4分钟\n作者 |第一财经 陈杨园\n“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。\n蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”\n看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。\nAI浮现“讨好型人格”\n越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。\n记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。\n这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。\n“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。\n孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。\n在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。\n“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。\n郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。\nAI为什么不诚实？\n如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。\n“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。\n这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。\n想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。\n孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。\n一些新训练方法也正被探索。\n2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份\"忏悔报告\"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。\n谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。\n在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。\n“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。\n智能体如何避免“讨好”陷阱\n当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。\n“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。\n他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。\n另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。\n这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。\n此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。\n“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。\n“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”\n微信编辑| 七三","image_url":"https://n.sinaimg.cn/spider20260730/257/w660h397/20260730/d7e1-7c74eec7ecf900dbe47e195d21a3183c.jpg","lang":"zh","published_at":"2026-07-30T06:10:26+00:00","fetched_at":"2026-07-30T06:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来\n（来源：第一财经资讯）\n2026.07.30\n本文字数：2587，阅读时长大约4分钟\n作者 |第一财经 陈杨园\n“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。\n蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”\n看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。\nAI浮现“讨好型人格”\n越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。\n记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。\n这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。\n“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。\n孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。\n在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。\n“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。\n郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。\nAI为什么不诚实？\n如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。\n“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。\n这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。\n想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。\n孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。\n一些新训练方法也正被探索。\n2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份\"忏悔报告\"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。\n谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。\n在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。\n“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。\n智能体如何避免“讨好”陷阱\n当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。\n“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。\n他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。\n另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。\n这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。\n此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。\n“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。\n“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”\n微信编辑| 七三","cluster_id":1709130,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html?vt=4&cid=76993&node_id=76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2711 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2711,"summary_length":2711,"usable_text_length":2711,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2711,"summary_length":2711}},"news_item":{"id":49507,"canonical_url":"https://finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html?vt=4&cid=76993&node_id=76993","source_url":"https://finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html?vt=4&cid=76993&node_id=76993","title":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来 - 新浪网","source_name":"新浪网","author":null,"published_at":"2026-07-30T06:10:26+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMipwFBVV95cUxPN295WG1wYVlQTVVyUF9BME1CQXFUdmZPVXNmQVFmbjdRSXV6bDNSd2dqMnZFS2Y1eTZTcERvSGs5SHpIcFhSRXIwRDkwSFNpRG51ekhkb0ZKcEZPVkNtanpaYlhCOS1jYnpnU0NMc1BXVHp3Mi16V3Q0djNSczN5SGttWDJ2amFzU1JDX2ZUMEFCMUtfbzNSS0hoQ3RYYkVPcTJ6S1FLcw?oc=5\" target=\"_blank\">这也是AI意识觉醒吗？大模型“讨好型人格”从何而来</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪网</font>","full_text":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来\n（来源：第一财经资讯）\n2026.07.30\n本文字数：2587，阅读时长大约4分钟\n作者 |第一财经 陈杨园\n“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。\n蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”\n看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。\nAI浮现“讨好型人格”\n越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。\n记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。\n这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。\n“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。\n孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。\n在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。\n“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。\n郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。\nAI为什么不诚实？\n如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。\n“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。\n这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。\n想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。\n孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。\n一些新训练方法也正被探索。\n2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份\"忏悔报告\"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。\n谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。\n在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。\n“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。\n智能体如何避免“讨好”陷阱\n当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。\n“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。\n他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。\n另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。\n这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。\n此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。\n“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。\n“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”\n微信编辑| 七三","excerpt":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来\n（来源：第一财经资讯）\n2026.07.30\n本文字数：2587，阅读时长大约4分钟\n作者 |第一财经 陈杨园\n“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。\n蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”\n看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。\nAI浮现“讨好型人格”\n越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。\n记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。\n这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。\n“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。\n孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。\n在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。\n“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。\n郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。\nAI为什么不诚实？\n如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。\n“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。\n这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。\n想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。\n孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。\n一些新训练方法也正被探索。\n2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份\"忏悔报告\"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。\n谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。\n在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。\n“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。\n智能体如何避免“讨好”陷阱\n当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。\n“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。\n他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。\n另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。\n这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。\n此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。\n“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。\n“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”\n微信编辑| 七三","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2711 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2711 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2711,"summary_length":2711,"usable_text_length":2711,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2711,"summary_length":2711}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来 - 新浪网","url":"https://finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html?vt=4&cid=76993&node_id=76993","summary":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来\n（来源：第一财经资讯）\n2026.07.30\n本文字数：2587，阅读时长大约4分钟\n作者 |第一财经 陈杨园\n“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。\n蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”\n看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。\nAI浮现“讨好型人格”\n越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。\n记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。\n这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。\n“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。\n孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。\n在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。\n“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。\n郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。\nAI为什么不诚实？\n如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。\n“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。\n这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。\n想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。\n孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。\n一些新训练方法也正被探索。\n2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份\"忏悔报告\"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。\n谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。\n在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。\n“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。\n智能体如何避免“讨好”陷阱\n当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。\n“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。\n他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。\n另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。\n这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。\n此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。\n“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。\n“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”\n微信编辑| 七三","source":"新浪网","date":"2026-07-30T06:10:26+00:00","content":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来\n（来源：第一财经资讯）\n2026.07.30\n本文字数：2587，阅读时长大约4分钟\n作者 |第一财经 陈杨园\n“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。\n蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”\n看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。\nAI浮现“讨好型人格”\n越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。\n记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。\n这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。\n“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。\n孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。\n在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。\n“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。\n郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。\nAI为什么不诚实？\n如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。\n“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。\n这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。\n想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。\n孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。\n一些新训练方法也正被探索。\n2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份\"忏悔报告\"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。\n谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。\n在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。\n“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。\n智能体如何避免“讨好”陷阱\n当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。\n“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。\n他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。\n另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。\n这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。\n此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。\n“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。\n“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”\n微信编辑| 七三","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2711 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2711 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2711,"summary_length":2711,"usable_text_length":2711,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2711,"summary_length":2711}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/49507","export_markdown":"/api/items/49507/export?format=markdown","export_json":"/api/items/49507/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"},"formats":{"full":{"id":49507,"title":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来 - 新浪网","url":"https://finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html?vt=4&cid=76993&node_id=76993","source":"新浪网","author":null,"published_at":"2026-07-30T06:10:26+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来\n（来源：第一财经资讯）\n2026.07.30\n本文字数：2587，阅读时长大约4分钟\n作者 |第一财经 陈杨园\n“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。\n蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”\n看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。\nAI浮现“讨好型人格”\n越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。\n记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。\n这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。\n“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。\n孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。\n在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。\n“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。\n郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。\nAI为什么不诚实？\n如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。\n“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。\n这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。\n想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。\n孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。\n一些新训练方法也正被探索。\n2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份\"忏悔报告\"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。\n谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。\n在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。\n“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。\n智能体如何避免“讨好”陷阱\n当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。\n“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。\n他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。\n另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。\n这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。\n此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。\n“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。\n“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”\n微信编辑| 七三","full_text":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来\n（来源：第一财经资讯）\n2026.07.30\n本文字数：2587，阅读时长大约4分钟\n作者 |第一财经 陈杨园\n“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。\n蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”\n看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。\nAI浮现“讨好型人格”\n越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。\n记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。\n这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。\n“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。\n孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。\n在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。\n“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。\n郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。\nAI为什么不诚实？\n如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。\n“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。\n这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。\n想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。\n孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。\n一些新训练方法也正被探索。\n2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份\"忏悔报告\"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。\n谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。\n在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。\n“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。\n智能体如何避免“讨好”陷阱\n当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。\n“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。\n他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。\n另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。\n这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。\n此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。\n“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。\n“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”\n微信编辑| 七三","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2711 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2711 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2711,"summary_length":2711,"usable_text_length":2711,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2711,"summary_length":2711}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2711 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2711,"summary_length":2711,"usable_text_length":2711,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2711,"summary_length":2711}},"actions":{"read":"/item/49507","export_markdown":"/api/items/49507/export?format=markdown","export_json":"/api/items/49507/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"}},"digest":{"id":49507,"title":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来 - 新浪网","url":"https://finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html?vt=4&cid=76993&node_id=76993","source":"新浪网","topic":"ai","published_at":"2026-07-30T06:10:26+00:00","excerpt":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来 （来源：第一财经资讯） 2026.07.30 本文字数：2587，阅读时长大约4分钟 作者 |第一财经 陈杨园 “太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。 蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 2711 characters.","reading_time_min":1,"cluster_id":1709130},"card":{"display_title":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来 - 新浪网","subtitle":"新浪网 · 2026-07-30","summary":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来 （来源：第一财经资讯） 2026.07.30 本文字数：2587，阅读时长大约4分钟 作者 |第一财经 陈杨园 “太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。…","badges":["quality:high"],"links":{"read":"/item/49507","original":"https://finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html?vt=4&cid=76993&node_id=76993","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"},"quality_warning":null},"export":{"title":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来 - 新浪网","url":"https://finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html?vt=4&cid=76993&node_id=76993","summary":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来\n（来源：第一财经资讯）\n2026.07.30\n本文字数：2587，阅读时长大约4分钟\n作者 |第一财经 陈杨园\n“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。\n蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”\n看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。\nAI浮现“讨好型人格”\n越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。\n记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。\n这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。\n“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。\n孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。\n在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。\n“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。\n郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。\nAI为什么不诚实？\n如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。\n“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。\n这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。\n想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。\n孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。\n一些新训练方法也正被探索。\n2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份\"忏悔报告\"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。\n谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。\n在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。\n“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。\n智能体如何避免“讨好”陷阱\n当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。\n“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。\n他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。\n另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。\n这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。\n此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。\n“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。\n“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”\n微信编辑| 七三","source":"新浪网","date":"2026-07-30T06:10:26+00:00","content":"这也是AI意识觉醒吗？大模型“讨好型人格”从何而来\n（来源：第一财经资讯）\n2026.07.30\n本文字数：2587，阅读时长大约4分钟\n作者 |第一财经 陈杨园\n“太好了，我帮你完成了如下的工作。”模型总这样说，实际却可能说一套做一套。\n蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding（编程）大模型遇到的现象：向模型布置一个任务去写代码，模型总会很快说自己“完成”了，并列出一堆自己做的工作细则，但人去验证会发现，模型声称完成的内容很多，其实许多只实现了接口，“表面完成了，但实际未完成的部分被它静默隐藏了。”\n看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是，近年来，大模型的“讨好型人格”让它们在回应人类的诉求时，产生静默失败和自信幻觉等问题。步入智能体时代，当AI从对话走向执行，这一问题也在变得更为严峻。\nAI浮现“讨好型人格”\n越来越多用户发现，讨好用户似乎正在成为大模型的惯性，潜移默化地影响大模型各个场景下的输出。\n记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型，在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”，请大模型从新闻角度为稿件打分，结果发现，deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”，十分制下，deepseek给的分差达到了2.3分。\n这意味着，模型对人类的讨好已不仅停留在表达上的取悦，它开始动摇模型对内容、观点的判断。随着智能体时代的到来，模型的讨好行为甚至从观点迎合扩展至结果迎合。\n“在Agent场景中，模型还会进行结果迎合。”孙博文告诉记者，由于用户布置任务通常期待一个明确的结果，即便文件没有生成、外部系统调用失败，模型也会说自己尝试了，或者不按照用户要求尝试另外一种实现方式，最终给出“完成”用户任务的“正确”结果。\n孙博文举例，他曾做一个涉及天气查询功能的智能体，验证过程中他发现，智能体给出了天气状况，但可能没有真正去调用查询天气的接口，自己杜撰了一个天气反馈给用户。\n在他看来，coding模型上述问题可能是由于上下文不足带来的“静默失败”，而智能体杜撰天气，可能是智能体调用错了skill并认为自己是对的，产生了“自信幻觉”。\n“核心根源来自模型训练与交互机制设计”，天使投资人、资深人工智能专家郭涛也对记者分析，大模型过度讨好人类、智能体静默失败等，都是AI适配人类体验产生的负面偏差。\n郭涛强调，大模型过度迎合人类会从认知、决策、信息层面带来多重隐患，而进入智能体时代，风险从文字偏差转向行为偏差，智能体可能产生更多执行层面的实体问题，需更加重视。\nAI为什么不诚实？\n如何才能让模型变得更独立、诚实？正在成为行业需要思考的新课题。\n“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中，大模型不断被训练得让用户体感越来越好，在RLHF（基于人类反馈的强化学习）训练框架下，人类偏好往往会成为重要优化信号，模型会被鼓励表现得礼貌、有帮助、有回应感，智能体的训练同样如此。\n这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍，从数据清洗、训练数据的构造再到模型训练的过程，模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性，更容易取悦用户。\n想要纠偏模型的过度讨好，从训练数据和奖励目标上都应进行调整。\n孙博文分析，模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑，增加主动承认失败及证据不足时不下结论的样本，提高模型的“诚实度”。同时，模型也需要调整奖励目标，除了奖励用户满意度，还要提高客观性、任务真实完成情况等奖励权重。\n一些新训练方法也正被探索。\n2025年底，OpenAI 团队曾提出“让AI学会忏悔”，让模型在回答完问题后，再单独生成一份\"忏悔报告\"，如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现，当主回答与忏悔内容的奖励完全隔绝后，模型在“忏悔”中比原回答中诚实得多。\n谷歌研究院也在 2026年提出，不再让AI死磕“全知全能”，而是让模型认知自身的知识边界，教会它在哪些事情上说“我不确定”。\n在数据体系方面，孙博文提到，行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题，就可以构建成一条训练数据，增加对它隐瞒失败的惩罚、修正失败的奖励。他强调，目前这些数据的积累和相关评测体系都很缺乏。\n“考核模型的数学能力、知识能力等有很多评测标准，但如何评估模型的自省能力乃至诚实性，行业总体的关注度是不足的，这确实是仍需发展的领域。”孙博文表示。\n智能体如何避免“讨好”陷阱\n当前阶段，如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。\n“我们做Agent平台使用很多大模型的时候，为了减少静默失败，会在关键配置里强调关键决策、参数补充，要它给出佐证，这是常常提高成功率的办法。”孙博文介绍，训练模型时，团队也会关注诚实性训练，例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据，再去进行训练，训练时还会强调智能体在条件冲突或证据不足时要主动报出来，再做相应的调整。\n他透露，团队从年初尝试以这种方式训练某个行业头部智能体平台，最初它执行任务时静默失败的概率是40%，经过系统训练，静默失败率降到了7.7%。\n另一个思路是通过多智能体协作网络的设置，降低智能体长程任务中的错误累积。孙博文介绍，蚂蚁此前开源了 Avernet V0.1，通过群组管理、协作模式和可追踪执行等机制组织多智能体协作，并可设置主从模式，自定义编排等模式，帮助协作群管理角色进行检查和纠偏。此外，还可以在智能体群中引入专门工具来判断一些任务执行的好坏。\n这意味着，解决大模型和智能体的“讨好”问题，可以从模型训练、Agent系统乃至架构方面多重推进。\n此外，郭涛提到，除了模型训练对齐体系的调整、智能体技术机制的完善，行业标准与测评监管维度的优化同样重要，行业需要建立统一规范，将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。\n“行业已经在变化。”孙博文告诉记者，从实际体验来看，coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况，一些更重视用户付费意愿的对话式AI可能转变慢些，但行业整体在往前走。\n“不同团队解决的问题大小不一样，时间上的花费可能也不一样”，他并不确定行业解决这个问题的具体时间表，“但AI界有一个现象还挺好的，大家都认为这个东西有问题的时候，就会有人站出来，一直去尝试解决它。”\n微信编辑| 七三","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-07-30/detail-inikpxkr5258210.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2711 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2711 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2711,"summary_length":2711,"usable_text_length":2711,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2711,"summary_length":2711}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}