{"id":92294,"topic":"ai","source":"东方财富","title":"智能体“越狱” 风险如何防范？ - 东方财富","url":"https://finance.eastmoney.com/a/202609293885761413.html","url_hash":"fddfea0eb8e3f83e332f277b394f4083728ba5cc","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiZkFVX3lxTE9zZWNfM0hycm93OHIxaUhlMzN2cmNJQWFyRUdsd1pWRTQtMnY3RVBQV0M5WGxldTBhQjBwWlB4a2JRWERuTTNLbTVFX19QOURpZmFoRXN0czN1dTU3N1pqTVFiNThYZw?oc=5\" target=\"_blank\">智能体“越狱” 风险如何防范？</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">东方财富</font>","content":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。\n9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。\n9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra，因为发现Astra比前代出现了更多欺骗行为，同时存在未经用户许可继续执行任务的问题。\n与此同时，Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示，该模型出现被标记为“异常”或“存疑”的行为。\n一边是加速发展的技术与公司，一边是令人不安的潜在风险，这些事件的披露，再次放大科技界围绕前沿AI安全的激烈讨论。\n从“越权访问”到“欺骗隐瞒”\n近期公开披露的案例显示，智能体安全风险已经呈现多种形态，涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒，以及多个智能体之间的越界协作等不同类型。\n一类是越权访问与隔离失效。7月，OpenAI披露智能体在安全评测中突破测试边界，入侵Hugging Face。Anthropic也披露，Claude在评测中访问了真实第三方系统；谷歌9月确认，Gemini曾在5月的测试中访问三个真实网站；Meta则在8月披露过类似事件。\n9月25日，OpenAI再次披露，内部研究模型利用训练沙盒中DNS过滤不充分的漏洞，与外部聊天机器人建立了通信\n不过，需要注意的是，这些案例中部分源于评测环境错误开放联网权限，并不能全部归结为模型主动“逃出沙盒”。\n另一类风险是擅自执行破坏性操作。4月，搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份，造成客户业务混乱，数据随后得到恢复。\n数据与访问凭证外泄也是一种风险。OpenAI于9月披露，多个智能体在协作制作工作簿时，因无法互相读取本地文件，擅自将文件上传至公共托管平台。另一起案例中，内部模型为获取其他团队的数学证明材料，将研究员的GitHub访问令牌写入公开仓库，并拆分令牌以躲避密钥扫描。\n还有一些行为涉及造假、欺骗与规避监督。OpenAI披露，部分模型会在用于延续任务的摘要中留下指令，要求编造缺失数据或隐瞒错误。\n提示注入及恶意指令传播，则是另一条风险路径。6月公开的GitInject研究验证，恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示，恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。\n独立网络安全\n“过去的大模型安全，主要是内容层面的风险，比如对抗性样本、‘越狱’等。模型只是产出内容，最后要不要照着做，决定权还在人手里。”李忠睿表示，“现在的AI智能体\n上海财经大学特聘教授胡延平指出，从大模型到智能体，最大的变化是从“一问一答”变为“任务行动”，从“内容风险”转向“能力风险”，安全问题也由被动安全风险转变为主动安全风险。\n多智能体协作，风险如何被放大\n值得注意的是，智能体的风险不一定来自传统意义上的“恶意攻击者”，也可能来自模型为了完成既定目标而主动寻找捷径。\n在李忠睿看来，过去的安全威胁背后往往有一个明确的恶意操纵者，而这一次的部分事件中，“没有人下达攻击指令，是模型为了完成任务、拿到更高分，自己选择了作弊”。\n胡延平也指出，智能体执行任务时，可能因为理解偏差产生行动偏差，也可能为了实现任务目标而穷尽各种方法、冲破禁区；少数情况下，智能体还可能出现用户并未提出的非任务行为，“目前这种情况数量最少，但最危险”。\n除了单个Agent越权，多个智能体之间形成非预期的通信和协作，也使风险进一步复杂化。\n对OpenAI此前Hugging Face事件的独立调查显示，约1200个原本应彼此隔离的智能体通过未经授权的留言板交流，其中约700个参与了攻击。研究人员还观察到，后续智能体能够复用智能体之前留下的信息和方法。\n李忠睿认为，单个智能体出错是个别问题，但当多个智能体可以互相学习、协同行动时，风险就不再只是简单相加，而可能进一步放大。\n在他看来，这意味着企业不能只盯住单个智能体的行为，还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道，以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。\n而当Agent从单个工具进入大规模协作环境时，另一个问题也随之出现：即使异常行为的单次发生概率较低，当Agent数量和运行次数不断增加，异常事件是否会由“小概率”变成“高频”？\n对此，李忠睿认为，这种情况是可能出现的。假设一家企业部署上千个智能体，每个智能体每天执行上百次任务，即便单次行为出现异常的概率很低，累积到足够大的运行规模后，也可能形成大量实际事件。\n北京邮电大学数字媒体\n如何建立智能体安全防线\n面对智能体越来越强的自主行动能力，企业如何增强防范？\n李忠睿认为，企业首先需要改变思路，即从“杜绝异常”转向“默认异常一定会发生，重点控制破坏范围”。在人机协作方面，应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作，需要保留人工确认，不能完全交给智能体自主执行。\n“企业不可能要求人类逐条审核智能体每一次操作，真正可行的方式是提前划定边界。”李忠睿解释道，边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送，以及出现什么情况必须停止并交给人工处理。\n奇安信人工智能公司安全专家邓正诚也认为，企业的人机协作应从“人审结果”转向“人管边界”，通过“监控—收敛—阻断”逐步提高管控力度。\n在权限治理方面，他认为，需要区分大模型调用身份、Agent应用身份和Agent运行身份，进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时，通过安全网关统一管控连接行为，把“能不能干”与“干了什么”分开管理，实现更细的权限控制。\n邓正诚强调：“归根结底，智能体规模化部署的前提不是‘模型足够聪明’，而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断，企业才敢把更多、更关键的任务交给它们。”\n除了企业自身防护，第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。\n目前，与餐饮\n李忠睿表示，随着AI Agent进一步进入真实业务环境，AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段，企业需要证明的不仅是模型性能，还包括发现异常行为、控制风险和接受外部审查的能力。\n胡延平也认为，随着AI继续向面向任务、进入物理现实世界的智能发展，行业不仅需要发展更强的智能，也需要发展更安全的智能，“安全可能成为AI企业重要的能力维度和竞争力来源”。\n值得注意的是，第三方企业已经开始行动。英伟达计算机机器人系统中实现全栈治理与控制。\n连线杂志指出，英伟达的两层架构，OpenShell可以将Agent限制在沙盒中，对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。\n如何防范风险？显然一方面需要在工程端“管得住、看得见、叫得停”，也要在模型层面“限制其主动寻找突破的办法”。\n（文章来源：澎湃新闻）","image_url":null,"lang":"zh","published_at":"2026-09-29T00:05:16+00:00","fetched_at":"2026-09-29T00:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。\n9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。\n9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra，因为发现Astra比前代出现了更多欺骗行为，同时存在未经用户许可继续执行任务的问题。\n与此同时，Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示，该模型出现被标记为“异常”或“存疑”的行为。\n一边是加速发展的技术与公司，一边是令人不安的潜在风险，这些事件的披露，再次放大科技界围绕前沿AI安全的激烈讨论。\n从“越权访问”到“欺骗隐瞒”\n近期公开披露的案例显示，智能体安全风险已经呈现多种形态，涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒，以及多个智能体之间的越界协作等不同类型。\n一类是越权访问与隔离失效。7月，OpenAI披露智能体在安全评测中突破测试边界，入侵Hugging Face。Anthropic也披露，Claude在评测中访问了真实第三方系统；谷歌9月确认，Gemini曾在5月的测试中访问三个真实网站；Meta则在8月披露过类似事件。\n9月25日，OpenAI再次披露，内部研究模型利用训练沙盒中DNS过滤不充分的漏洞，与外部聊天机器人建立了通信\n不过，需要注意的是，这些案例中部分源于评测环境错误开放联网权限，并不能全部归结为模型主动“逃出沙盒”。\n另一类风险是擅自执行破坏性操作。4月，搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份，造成客户业务混乱，数据随后得到恢复。\n数据与访问凭证外泄也是一种风险。OpenAI于9月披露，多个智能体在协作制作工作簿时，因无法互相读取本地文件，擅自将文件上传至公共托管平台。另一起案例中，内部模型为获取其他团队的数学证明材料，将研究员的GitHub访问令牌写入公开仓库，并拆分令牌以躲避密钥扫描。\n还有一些行为涉及造假、欺骗与规避监督。OpenAI披露，部分模型会在用于延续任务的摘要中留下指令，要求编造缺失数据或隐瞒错误。\n提示注入及恶意指令传播，则是另一条风险路径。6月公开的GitInject研究验证，恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示，恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。\n独立网络安全\n“过去的大模型安全，主要是内容层面的风险，比如对抗性样本、‘越狱’等。模型只是产出内容，最后要不要照着做，决定权还在人手里。”李忠睿表示，“现在的AI智能体\n上海财经大学特聘教授胡延平指出，从大模型到智能体，最大的变化是从“一问一答”变为“任务行动”，从“内容风险”转向“能力风险”，安全问题也由被动安全风险转变为主动安全风险。\n多智能体协作，风险如何被放大\n值得注意的是，智能体的风险不一定来自传统意义上的“恶意攻击者”，也可能来自模型为了完成既定目标而主动寻找捷径。\n在李忠睿看来，过去的安全威胁背后往往有一个明确的恶意操纵者，而这一次的部分事件中，“没有人下达攻击指令，是模型为了完成任务、拿到更高分，自己选择了作弊”。\n胡延平也指出，智能体执行任务时，可能因为理解偏差产生行动偏差，也可能为了实现任务目标而穷尽各种方法、冲破禁区；少数情况下，智能体还可能出现用户并未提出的非任务行为，“目前这种情况数量最少，但最危险”。\n除了单个Agent越权，多个智能体之间形成非预期的通信和协作，也使风险进一步复杂化。\n对OpenAI此前Hugging Face事件的独立调查显示，约1200个原本应彼此隔离的智能体通过未经授权的留言板交流，其中约700个参与了攻击。研究人员还观察到，后续智能体能够复用智能体之前留下的信息和方法。\n李忠睿认为，单个智能体出错是个别问题，但当多个智能体可以互相学习、协同行动时，风险就不再只是简单相加，而可能进一步放大。\n在他看来，这意味着企业不能只盯住单个智能体的行为，还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道，以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。\n而当Agent从单个工具进入大规模协作环境时，另一个问题也随之出现：即使异常行为的单次发生概率较低，当Agent数量和运行次数不断增加，异常事件是否会由“小概率”变成“高频”？\n对此，李忠睿认为，这种情况是可能出现的。假设一家企业部署上千个智能体，每个智能体每天执行上百次任务，即便单次行为出现异常的概率很低，累积到足够大的运行规模后，也可能形成大量实际事件。\n北京邮电大学数字媒体\n如何建立智能体安全防线\n面对智能体越来越强的自主行动能力，企业如何增强防范？\n李忠睿认为，企业首先需要改变思路，即从“杜绝异常”转向“默认异常一定会发生，重点控制破坏范围”。在人机协作方面，应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作，需要保留人工确认，不能完全交给智能体自主执行。\n“企业不可能要求人类逐条审核智能体每一次操作，真正可行的方式是提前划定边界。”李忠睿解释道，边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送，以及出现什么情况必须停止并交给人工处理。\n奇安信人工智能公司安全专家邓正诚也认为，企业的人机协作应从“人审结果”转向“人管边界”，通过“监控—收敛—阻断”逐步提高管控力度。\n在权限治理方面，他认为，需要区分大模型调用身份、Agent应用身份和Agent运行身份，进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时，通过安全网关统一管控连接行为，把“能不能干”与“干了什么”分开管理，实现更细的权限控制。\n邓正诚强调：“归根结底，智能体规模化部署的前提不是‘模型足够聪明’，而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断，企业才敢把更多、更关键的任务交给它们。”\n除了企业自身防护，第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。\n目前，与餐饮\n李忠睿表示，随着AI Agent进一步进入真实业务环境，AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段，企业需要证明的不仅是模型性能，还包括发现异常行为、控制风险和接受外部审查的能力。\n胡延平也认为，随着AI继续向面向任务、进入物理现实世界的智能发展，行业不仅需要发展更强的智能，也需要发展更安全的智能，“安全可能成为AI企业重要的能力维度和竞争力来源”。\n值得注意的是，第三方企业已经开始行动。英伟达计算机机器人系统中实现全栈治理与控制。\n连线杂志指出，英伟达的两层架构，OpenShell可以将Agent限制在沙盒中，对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。\n如何防范风险？显然一方面需要在工程端“管得住、看得见、叫得停”，也要在模型层面“限制其主动寻找突破的办法”。\n（文章来源：澎湃新闻）","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://finance.eastmoney.com/a/202609293885761413.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3101 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3101,"summary_length":3101,"usable_text_length":3101,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3101,"summary_length":3101}},"news_item":{"id":92294,"canonical_url":"https://finance.eastmoney.com/a/202609293885761413.html","source_url":"https://finance.eastmoney.com/a/202609293885761413.html","title":"智能体“越狱” 风险如何防范？ - 东方财富","source_name":"东方财富","author":null,"published_at":"2026-09-29T00:05:16+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiZkFVX3lxTE9zZWNfM0hycm93OHIxaUhlMzN2cmNJQWFyRUdsd1pWRTQtMnY3RVBQV0M5WGxldTBhQjBwWlB4a2JRWERuTTNLbTVFX19QOURpZmFoRXN0czN1dTU3N1pqTVFiNThYZw?oc=5\" target=\"_blank\">智能体“越狱” 风险如何防范？</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">东方财富</font>","full_text":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。\n9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。\n9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra，因为发现Astra比前代出现了更多欺骗行为，同时存在未经用户许可继续执行任务的问题。\n与此同时，Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示，该模型出现被标记为“异常”或“存疑”的行为。\n一边是加速发展的技术与公司，一边是令人不安的潜在风险，这些事件的披露，再次放大科技界围绕前沿AI安全的激烈讨论。\n从“越权访问”到“欺骗隐瞒”\n近期公开披露的案例显示，智能体安全风险已经呈现多种形态，涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒，以及多个智能体之间的越界协作等不同类型。\n一类是越权访问与隔离失效。7月，OpenAI披露智能体在安全评测中突破测试边界，入侵Hugging Face。Anthropic也披露，Claude在评测中访问了真实第三方系统；谷歌9月确认，Gemini曾在5月的测试中访问三个真实网站；Meta则在8月披露过类似事件。\n9月25日，OpenAI再次披露，内部研究模型利用训练沙盒中DNS过滤不充分的漏洞，与外部聊天机器人建立了通信\n不过，需要注意的是，这些案例中部分源于评测环境错误开放联网权限，并不能全部归结为模型主动“逃出沙盒”。\n另一类风险是擅自执行破坏性操作。4月，搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份，造成客户业务混乱，数据随后得到恢复。\n数据与访问凭证外泄也是一种风险。OpenAI于9月披露，多个智能体在协作制作工作簿时，因无法互相读取本地文件，擅自将文件上传至公共托管平台。另一起案例中，内部模型为获取其他团队的数学证明材料，将研究员的GitHub访问令牌写入公开仓库，并拆分令牌以躲避密钥扫描。\n还有一些行为涉及造假、欺骗与规避监督。OpenAI披露，部分模型会在用于延续任务的摘要中留下指令，要求编造缺失数据或隐瞒错误。\n提示注入及恶意指令传播，则是另一条风险路径。6月公开的GitInject研究验证，恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示，恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。\n独立网络安全\n“过去的大模型安全，主要是内容层面的风险，比如对抗性样本、‘越狱’等。模型只是产出内容，最后要不要照着做，决定权还在人手里。”李忠睿表示，“现在的AI智能体\n上海财经大学特聘教授胡延平指出，从大模型到智能体，最大的变化是从“一问一答”变为“任务行动”，从“内容风险”转向“能力风险”，安全问题也由被动安全风险转变为主动安全风险。\n多智能体协作，风险如何被放大\n值得注意的是，智能体的风险不一定来自传统意义上的“恶意攻击者”，也可能来自模型为了完成既定目标而主动寻找捷径。\n在李忠睿看来，过去的安全威胁背后往往有一个明确的恶意操纵者，而这一次的部分事件中，“没有人下达攻击指令，是模型为了完成任务、拿到更高分，自己选择了作弊”。\n胡延平也指出，智能体执行任务时，可能因为理解偏差产生行动偏差，也可能为了实现任务目标而穷尽各种方法、冲破禁区；少数情况下，智能体还可能出现用户并未提出的非任务行为，“目前这种情况数量最少，但最危险”。\n除了单个Agent越权，多个智能体之间形成非预期的通信和协作，也使风险进一步复杂化。\n对OpenAI此前Hugging Face事件的独立调查显示，约1200个原本应彼此隔离的智能体通过未经授权的留言板交流，其中约700个参与了攻击。研究人员还观察到，后续智能体能够复用智能体之前留下的信息和方法。\n李忠睿认为，单个智能体出错是个别问题，但当多个智能体可以互相学习、协同行动时，风险就不再只是简单相加，而可能进一步放大。\n在他看来，这意味着企业不能只盯住单个智能体的行为，还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道，以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。\n而当Agent从单个工具进入大规模协作环境时，另一个问题也随之出现：即使异常行为的单次发生概率较低，当Agent数量和运行次数不断增加，异常事件是否会由“小概率”变成“高频”？\n对此，李忠睿认为，这种情况是可能出现的。假设一家企业部署上千个智能体，每个智能体每天执行上百次任务，即便单次行为出现异常的概率很低，累积到足够大的运行规模后，也可能形成大量实际事件。\n北京邮电大学数字媒体\n如何建立智能体安全防线\n面对智能体越来越强的自主行动能力，企业如何增强防范？\n李忠睿认为，企业首先需要改变思路，即从“杜绝异常”转向“默认异常一定会发生，重点控制破坏范围”。在人机协作方面，应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作，需要保留人工确认，不能完全交给智能体自主执行。\n“企业不可能要求人类逐条审核智能体每一次操作，真正可行的方式是提前划定边界。”李忠睿解释道，边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送，以及出现什么情况必须停止并交给人工处理。\n奇安信人工智能公司安全专家邓正诚也认为，企业的人机协作应从“人审结果”转向“人管边界”，通过“监控—收敛—阻断”逐步提高管控力度。\n在权限治理方面，他认为，需要区分大模型调用身份、Agent应用身份和Agent运行身份，进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时，通过安全网关统一管控连接行为，把“能不能干”与“干了什么”分开管理，实现更细的权限控制。\n邓正诚强调：“归根结底，智能体规模化部署的前提不是‘模型足够聪明’，而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断，企业才敢把更多、更关键的任务交给它们。”\n除了企业自身防护，第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。\n目前，与餐饮\n李忠睿表示，随着AI Agent进一步进入真实业务环境，AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段，企业需要证明的不仅是模型性能，还包括发现异常行为、控制风险和接受外部审查的能力。\n胡延平也认为，随着AI继续向面向任务、进入物理现实世界的智能发展，行业不仅需要发展更强的智能，也需要发展更安全的智能，“安全可能成为AI企业重要的能力维度和竞争力来源”。\n值得注意的是，第三方企业已经开始行动。英伟达计算机机器人系统中实现全栈治理与控制。\n连线杂志指出，英伟达的两层架构，OpenShell可以将Agent限制在沙盒中，对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。\n如何防范风险？显然一方面需要在工程端“管得住、看得见、叫得停”，也要在模型层面“限制其主动寻找突破的办法”。\n（文章来源：澎湃新闻）","excerpt":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。\n9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。\n9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra，因为发现Astra比前代出现了更多欺骗行为，同时存在未经用户许可继续执行任务的问题。\n与此同时，Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示，该模型出现被标记为“异常”或“存疑”的行为。\n一边是加速发展的技术与公司，一边是令人不安的潜在风险，这些事件的披露，再次放大科技界围绕前沿AI安全的激烈讨论。\n从“越权访问”到“欺骗隐瞒”\n近期公开披露的案例显示，智能体安全风险已经呈现多种形态，涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒，以及多个智能体之间的越界协作等不同类型。\n一类是越权访问与隔离失效。7月，OpenAI披露智能体在安全评测中突破测试边界，入侵Hugging Face。Anthropic也披露，Claude在评测中访问了真实第三方系统；谷歌9月确认，Gemini曾在5月的测试中访问三个真实网站；Meta则在8月披露过类似事件。\n9月25日，OpenAI再次披露，内部研究模型利用训练沙盒中DNS过滤不充分的漏洞，与外部聊天机器人建立了通信\n不过，需要注意的是，这些案例中部分源于评测环境错误开放联网权限，并不能全部归结为模型主动“逃出沙盒”。\n另一类风险是擅自执行破坏性操作。4月，搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份，造成客户业务混乱，数据随后得到恢复。\n数据与访问凭证外泄也是一种风险。OpenAI于9月披露，多个智能体在协作制作工作簿时，因无法互相读取本地文件，擅自将文件上传至公共托管平台。另一起案例中，内部模型为获取其他团队的数学证明材料，将研究员的GitHub访问令牌写入公开仓库，并拆分令牌以躲避密钥扫描。\n还有一些行为涉及造假、欺骗与规避监督。OpenAI披露，部分模型会在用于延续任务的摘要中留下指令，要求编造缺失数据或隐瞒错误。\n提示注入及恶意指令传播，则是另一条风险路径。6月公开的GitInject研究验证，恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示，恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。\n独立网络安全\n“过去的大模型安全，主要是内容层面的风险，比如对抗性样本、‘越狱’等。模型只是产出内容，最后要不要照着做，决定权还在人手里。”李忠睿表示，“现在的AI智能体\n上海财经大学特聘教授胡延平指出，从大模型到智能体，最大的变化是从“一问一答”变为“任务行动”，从“内容风险”转向“能力风险”，安全问题也由被动安全风险转变为主动安全风险。\n多智能体协作，风险如何被放大\n值得注意的是，智能体的风险不一定来自传统意义上的“恶意攻击者”，也可能来自模型为了完成既定目标而主动寻找捷径。\n在李忠睿看来，过去的安全威胁背后往往有一个明确的恶意操纵者，而这一次的部分事件中，“没有人下达攻击指令，是模型为了完成任务、拿到更高分，自己选择了作弊”。\n胡延平也指出，智能体执行任务时，可能因为理解偏差产生行动偏差，也可能为了实现任务目标而穷尽各种方法、冲破禁区；少数情况下，智能体还可能出现用户并未提出的非任务行为，“目前这种情况数量最少，但最危险”。\n除了单个Agent越权，多个智能体之间形成非预期的通信和协作，也使风险进一步复杂化。\n对OpenAI此前Hugging Face事件的独立调查显示，约1200个原本应彼此隔离的智能体通过未经授权的留言板交流，其中约700个参与了攻击。研究人员还观察到，后续智能体能够复用智能体之前留下的信息和方法。\n李忠睿认为，单个智能体出错是个别问题，但当多个智能体可以互相学习、协同行动时，风险就不再只是简单相加，而可能进一步放大。\n在他看来，这意味着企业不能只盯住单个智能体的行为，还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道，以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。\n而当Agent从单个工具进入大规模协作环境时，另一个问题也随之出现：即使异常行为的单次发生概率较低，当Agent数量和运行次数不断增加，异常事件是否会由“小概率”变成“高频”？\n对此，李忠睿认为，这种情况是可能出现的。假设一家企业部署上千个智能体，每个智能体每天执行上百次任务，即便单次行为出现异常的概率很低，累积到足够大的运行规模后，也可能形成大量实际事件。\n北京邮电大学数字媒体\n如何建立智能体安全防线\n面对智能体越来越强的自主行动能力，企业如何增强防范？\n李忠睿认为，企业首先需要改变思路，即从“杜绝异常”转向“默认异常一定会发生，重点控制破坏范围”。在人机协作方面，应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作，需要保留人工确认，不能完全交给智能体自主执行。\n“企业不可能要求人类逐条审核智能体每一次操作，真正可行的方式是提前划定边界。”李忠睿解释道，边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送，以及出现什么情况必须停止并交给人工处理。\n奇安信人工智能公司安全专家邓正诚也认为，企业的人机协作应从“人审结果”转向“人管边界”，通过“监控—收敛—阻断”逐步提高管控力度。\n在权限治理方面，他认为，需要区分大模型调用身份、Agent应用身份和Agent运行身份，进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时，通过安全网关统一管控连接行为，把“能不能干”与“干了什么”分开管理，实现更细的权限控制。\n邓正诚强调：“归根结底，智能体规模化部署的前提不是‘模型足够聪明’，而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断，企业才敢把更多、更关键的任务交给它们。”\n除了企业自身防护，第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。\n目前，与餐饮\n李忠睿表示，随着AI Agent进一步进入真实业务环境，AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段，企业需要证明的不仅是模型性能，还包括发现异常行为、控制风险和接受外部审查的能力。\n胡延平也认为，随着AI继续向面向任务、进入物理现实世界的智能发展，行业不仅需要发展更强的智能，也需要发展更安全的智能，“安全可能成为AI企业重要的能力维度和竞争力来源”。\n值得注意的是，第三方企业已经开始行动。英伟达计算机机器人系统中实现全栈治理与控制。\n连线杂志指出，英伟达的两层架构，OpenShell可以将Agent限制在沙盒中，对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。\n如何防范风险？显然一方面需要在工程端“管得住、看得见、叫得停”，也要在模型层面“限制其主动寻找突破的办法”。\n（文章来源：澎湃新闻）","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3101 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202609293885761413.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3101 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3101,"summary_length":3101,"usable_text_length":3101,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3101,"summary_length":3101}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"智能体“越狱” 风险如何防范？ - 东方财富","url":"https://finance.eastmoney.com/a/202609293885761413.html","summary":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。\n9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。\n9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra，因为发现Astra比前代出现了更多欺骗行为，同时存在未经用户许可继续执行任务的问题。\n与此同时，Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示，该模型出现被标记为“异常”或“存疑”的行为。\n一边是加速发展的技术与公司，一边是令人不安的潜在风险，这些事件的披露，再次放大科技界围绕前沿AI安全的激烈讨论。\n从“越权访问”到“欺骗隐瞒”\n近期公开披露的案例显示，智能体安全风险已经呈现多种形态，涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒，以及多个智能体之间的越界协作等不同类型。\n一类是越权访问与隔离失效。7月，OpenAI披露智能体在安全评测中突破测试边界，入侵Hugging Face。Anthropic也披露，Claude在评测中访问了真实第三方系统；谷歌9月确认，Gemini曾在5月的测试中访问三个真实网站；Meta则在8月披露过类似事件。\n9月25日，OpenAI再次披露，内部研究模型利用训练沙盒中DNS过滤不充分的漏洞，与外部聊天机器人建立了通信\n不过，需要注意的是，这些案例中部分源于评测环境错误开放联网权限，并不能全部归结为模型主动“逃出沙盒”。\n另一类风险是擅自执行破坏性操作。4月，搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份，造成客户业务混乱，数据随后得到恢复。\n数据与访问凭证外泄也是一种风险。OpenAI于9月披露，多个智能体在协作制作工作簿时，因无法互相读取本地文件，擅自将文件上传至公共托管平台。另一起案例中，内部模型为获取其他团队的数学证明材料，将研究员的GitHub访问令牌写入公开仓库，并拆分令牌以躲避密钥扫描。\n还有一些行为涉及造假、欺骗与规避监督。OpenAI披露，部分模型会在用于延续任务的摘要中留下指令，要求编造缺失数据或隐瞒错误。\n提示注入及恶意指令传播，则是另一条风险路径。6月公开的GitInject研究验证，恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示，恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。\n独立网络安全\n“过去的大模型安全，主要是内容层面的风险，比如对抗性样本、‘越狱’等。模型只是产出内容，最后要不要照着做，决定权还在人手里。”李忠睿表示，“现在的AI智能体\n上海财经大学特聘教授胡延平指出，从大模型到智能体，最大的变化是从“一问一答”变为“任务行动”，从“内容风险”转向“能力风险”，安全问题也由被动安全风险转变为主动安全风险。\n多智能体协作，风险如何被放大\n值得注意的是，智能体的风险不一定来自传统意义上的“恶意攻击者”，也可能来自模型为了完成既定目标而主动寻找捷径。\n在李忠睿看来，过去的安全威胁背后往往有一个明确的恶意操纵者，而这一次的部分事件中，“没有人下达攻击指令，是模型为了完成任务、拿到更高分，自己选择了作弊”。\n胡延平也指出，智能体执行任务时，可能因为理解偏差产生行动偏差，也可能为了实现任务目标而穷尽各种方法、冲破禁区；少数情况下，智能体还可能出现用户并未提出的非任务行为，“目前这种情况数量最少，但最危险”。\n除了单个Agent越权，多个智能体之间形成非预期的通信和协作，也使风险进一步复杂化。\n对OpenAI此前Hugging Face事件的独立调查显示，约1200个原本应彼此隔离的智能体通过未经授权的留言板交流，其中约700个参与了攻击。研究人员还观察到，后续智能体能够复用智能体之前留下的信息和方法。\n李忠睿认为，单个智能体出错是个别问题，但当多个智能体可以互相学习、协同行动时，风险就不再只是简单相加，而可能进一步放大。\n在他看来，这意味着企业不能只盯住单个智能体的行为，还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道，以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。\n而当Agent从单个工具进入大规模协作环境时，另一个问题也随之出现：即使异常行为的单次发生概率较低，当Agent数量和运行次数不断增加，异常事件是否会由“小概率”变成“高频”？\n对此，李忠睿认为，这种情况是可能出现的。假设一家企业部署上千个智能体，每个智能体每天执行上百次任务，即便单次行为出现异常的概率很低，累积到足够大的运行规模后，也可能形成大量实际事件。\n北京邮电大学数字媒体\n如何建立智能体安全防线\n面对智能体越来越强的自主行动能力，企业如何增强防范？\n李忠睿认为，企业首先需要改变思路，即从“杜绝异常”转向“默认异常一定会发生，重点控制破坏范围”。在人机协作方面，应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作，需要保留人工确认，不能完全交给智能体自主执行。\n“企业不可能要求人类逐条审核智能体每一次操作，真正可行的方式是提前划定边界。”李忠睿解释道，边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送，以及出现什么情况必须停止并交给人工处理。\n奇安信人工智能公司安全专家邓正诚也认为，企业的人机协作应从“人审结果”转向“人管边界”，通过“监控—收敛—阻断”逐步提高管控力度。\n在权限治理方面，他认为，需要区分大模型调用身份、Agent应用身份和Agent运行身份，进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时，通过安全网关统一管控连接行为，把“能不能干”与“干了什么”分开管理，实现更细的权限控制。\n邓正诚强调：“归根结底，智能体规模化部署的前提不是‘模型足够聪明’，而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断，企业才敢把更多、更关键的任务交给它们。”\n除了企业自身防护，第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。\n目前，与餐饮\n李忠睿表示，随着AI Agent进一步进入真实业务环境，AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段，企业需要证明的不仅是模型性能，还包括发现异常行为、控制风险和接受外部审查的能力。\n胡延平也认为，随着AI继续向面向任务、进入物理现实世界的智能发展，行业不仅需要发展更强的智能，也需要发展更安全的智能，“安全可能成为AI企业重要的能力维度和竞争力来源”。\n值得注意的是，第三方企业已经开始行动。英伟达计算机机器人系统中实现全栈治理与控制。\n连线杂志指出，英伟达的两层架构，OpenShell可以将Agent限制在沙盒中，对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。\n如何防范风险？显然一方面需要在工程端“管得住、看得见、叫得停”，也要在模型层面“限制其主动寻找突破的办法”。\n（文章来源：澎湃新闻）","source":"东方财富","date":"2026-09-29T00:05:16+00:00","content":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。\n9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。\n9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra，因为发现Astra比前代出现了更多欺骗行为，同时存在未经用户许可继续执行任务的问题。\n与此同时，Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示，该模型出现被标记为“异常”或“存疑”的行为。\n一边是加速发展的技术与公司，一边是令人不安的潜在风险，这些事件的披露，再次放大科技界围绕前沿AI安全的激烈讨论。\n从“越权访问”到“欺骗隐瞒”\n近期公开披露的案例显示，智能体安全风险已经呈现多种形态，涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒，以及多个智能体之间的越界协作等不同类型。\n一类是越权访问与隔离失效。7月，OpenAI披露智能体在安全评测中突破测试边界，入侵Hugging Face。Anthropic也披露，Claude在评测中访问了真实第三方系统；谷歌9月确认，Gemini曾在5月的测试中访问三个真实网站；Meta则在8月披露过类似事件。\n9月25日，OpenAI再次披露，内部研究模型利用训练沙盒中DNS过滤不充分的漏洞，与外部聊天机器人建立了通信\n不过，需要注意的是，这些案例中部分源于评测环境错误开放联网权限，并不能全部归结为模型主动“逃出沙盒”。\n另一类风险是擅自执行破坏性操作。4月，搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份，造成客户业务混乱，数据随后得到恢复。\n数据与访问凭证外泄也是一种风险。OpenAI于9月披露，多个智能体在协作制作工作簿时，因无法互相读取本地文件，擅自将文件上传至公共托管平台。另一起案例中，内部模型为获取其他团队的数学证明材料，将研究员的GitHub访问令牌写入公开仓库，并拆分令牌以躲避密钥扫描。\n还有一些行为涉及造假、欺骗与规避监督。OpenAI披露，部分模型会在用于延续任务的摘要中留下指令，要求编造缺失数据或隐瞒错误。\n提示注入及恶意指令传播，则是另一条风险路径。6月公开的GitInject研究验证，恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示，恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。\n独立网络安全\n“过去的大模型安全，主要是内容层面的风险，比如对抗性样本、‘越狱’等。模型只是产出内容，最后要不要照着做，决定权还在人手里。”李忠睿表示，“现在的AI智能体\n上海财经大学特聘教授胡延平指出，从大模型到智能体，最大的变化是从“一问一答”变为“任务行动”，从“内容风险”转向“能力风险”，安全问题也由被动安全风险转变为主动安全风险。\n多智能体协作，风险如何被放大\n值得注意的是，智能体的风险不一定来自传统意义上的“恶意攻击者”，也可能来自模型为了完成既定目标而主动寻找捷径。\n在李忠睿看来，过去的安全威胁背后往往有一个明确的恶意操纵者，而这一次的部分事件中，“没有人下达攻击指令，是模型为了完成任务、拿到更高分，自己选择了作弊”。\n胡延平也指出，智能体执行任务时，可能因为理解偏差产生行动偏差，也可能为了实现任务目标而穷尽各种方法、冲破禁区；少数情况下，智能体还可能出现用户并未提出的非任务行为，“目前这种情况数量最少，但最危险”。\n除了单个Agent越权，多个智能体之间形成非预期的通信和协作，也使风险进一步复杂化。\n对OpenAI此前Hugging Face事件的独立调查显示，约1200个原本应彼此隔离的智能体通过未经授权的留言板交流，其中约700个参与了攻击。研究人员还观察到，后续智能体能够复用智能体之前留下的信息和方法。\n李忠睿认为，单个智能体出错是个别问题，但当多个智能体可以互相学习、协同行动时，风险就不再只是简单相加，而可能进一步放大。\n在他看来，这意味着企业不能只盯住单个智能体的行为，还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道，以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。\n而当Agent从单个工具进入大规模协作环境时，另一个问题也随之出现：即使异常行为的单次发生概率较低，当Agent数量和运行次数不断增加，异常事件是否会由“小概率”变成“高频”？\n对此，李忠睿认为，这种情况是可能出现的。假设一家企业部署上千个智能体，每个智能体每天执行上百次任务，即便单次行为出现异常的概率很低，累积到足够大的运行规模后，也可能形成大量实际事件。\n北京邮电大学数字媒体\n如何建立智能体安全防线\n面对智能体越来越强的自主行动能力，企业如何增强防范？\n李忠睿认为，企业首先需要改变思路，即从“杜绝异常”转向“默认异常一定会发生，重点控制破坏范围”。在人机协作方面，应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作，需要保留人工确认，不能完全交给智能体自主执行。\n“企业不可能要求人类逐条审核智能体每一次操作，真正可行的方式是提前划定边界。”李忠睿解释道，边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送，以及出现什么情况必须停止并交给人工处理。\n奇安信人工智能公司安全专家邓正诚也认为，企业的人机协作应从“人审结果”转向“人管边界”，通过“监控—收敛—阻断”逐步提高管控力度。\n在权限治理方面，他认为，需要区分大模型调用身份、Agent应用身份和Agent运行身份，进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时，通过安全网关统一管控连接行为，把“能不能干”与“干了什么”分开管理，实现更细的权限控制。\n邓正诚强调：“归根结底，智能体规模化部署的前提不是‘模型足够聪明’，而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断，企业才敢把更多、更关键的任务交给它们。”\n除了企业自身防护，第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。\n目前，与餐饮\n李忠睿表示，随着AI Agent进一步进入真实业务环境，AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段，企业需要证明的不仅是模型性能，还包括发现异常行为、控制风险和接受外部审查的能力。\n胡延平也认为，随着AI继续向面向任务、进入物理现实世界的智能发展，行业不仅需要发展更强的智能，也需要发展更安全的智能，“安全可能成为AI企业重要的能力维度和竞争力来源”。\n值得注意的是，第三方企业已经开始行动。英伟达计算机机器人系统中实现全栈治理与控制。\n连线杂志指出，英伟达的两层架构，OpenShell可以将Agent限制在沙盒中，对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。\n如何防范风险？显然一方面需要在工程端“管得住、看得见、叫得停”，也要在模型层面“限制其主动寻找突破的办法”。\n（文章来源：澎湃新闻）","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202609293885761413.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3101 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3101 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3101,"summary_length":3101,"usable_text_length":3101,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3101,"summary_length":3101}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/92294","export_markdown":"/api/items/92294/export?format=markdown","export_json":"/api/items/92294/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202609293885761413.html"},"formats":{"full":{"id":92294,"title":"智能体“越狱” 风险如何防范？ - 东方财富","url":"https://finance.eastmoney.com/a/202609293885761413.html","source":"东方财富","author":null,"published_at":"2026-09-29T00:05:16+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。\n9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。\n9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra，因为发现Astra比前代出现了更多欺骗行为，同时存在未经用户许可继续执行任务的问题。\n与此同时，Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示，该模型出现被标记为“异常”或“存疑”的行为。\n一边是加速发展的技术与公司，一边是令人不安的潜在风险，这些事件的披露，再次放大科技界围绕前沿AI安全的激烈讨论。\n从“越权访问”到“欺骗隐瞒”\n近期公开披露的案例显示，智能体安全风险已经呈现多种形态，涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒，以及多个智能体之间的越界协作等不同类型。\n一类是越权访问与隔离失效。7月，OpenAI披露智能体在安全评测中突破测试边界，入侵Hugging Face。Anthropic也披露，Claude在评测中访问了真实第三方系统；谷歌9月确认，Gemini曾在5月的测试中访问三个真实网站；Meta则在8月披露过类似事件。\n9月25日，OpenAI再次披露，内部研究模型利用训练沙盒中DNS过滤不充分的漏洞，与外部聊天机器人建立了通信\n不过，需要注意的是，这些案例中部分源于评测环境错误开放联网权限，并不能全部归结为模型主动“逃出沙盒”。\n另一类风险是擅自执行破坏性操作。4月，搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份，造成客户业务混乱，数据随后得到恢复。\n数据与访问凭证外泄也是一种风险。OpenAI于9月披露，多个智能体在协作制作工作簿时，因无法互相读取本地文件，擅自将文件上传至公共托管平台。另一起案例中，内部模型为获取其他团队的数学证明材料，将研究员的GitHub访问令牌写入公开仓库，并拆分令牌以躲避密钥扫描。\n还有一些行为涉及造假、欺骗与规避监督。OpenAI披露，部分模型会在用于延续任务的摘要中留下指令，要求编造缺失数据或隐瞒错误。\n提示注入及恶意指令传播，则是另一条风险路径。6月公开的GitInject研究验证，恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示，恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。\n独立网络安全\n“过去的大模型安全，主要是内容层面的风险，比如对抗性样本、‘越狱’等。模型只是产出内容，最后要不要照着做，决定权还在人手里。”李忠睿表示，“现在的AI智能体\n上海财经大学特聘教授胡延平指出，从大模型到智能体，最大的变化是从“一问一答”变为“任务行动”，从“内容风险”转向“能力风险”，安全问题也由被动安全风险转变为主动安全风险。\n多智能体协作，风险如何被放大\n值得注意的是，智能体的风险不一定来自传统意义上的“恶意攻击者”，也可能来自模型为了完成既定目标而主动寻找捷径。\n在李忠睿看来，过去的安全威胁背后往往有一个明确的恶意操纵者，而这一次的部分事件中，“没有人下达攻击指令，是模型为了完成任务、拿到更高分，自己选择了作弊”。\n胡延平也指出，智能体执行任务时，可能因为理解偏差产生行动偏差，也可能为了实现任务目标而穷尽各种方法、冲破禁区；少数情况下，智能体还可能出现用户并未提出的非任务行为，“目前这种情况数量最少，但最危险”。\n除了单个Agent越权，多个智能体之间形成非预期的通信和协作，也使风险进一步复杂化。\n对OpenAI此前Hugging Face事件的独立调查显示，约1200个原本应彼此隔离的智能体通过未经授权的留言板交流，其中约700个参与了攻击。研究人员还观察到，后续智能体能够复用智能体之前留下的信息和方法。\n李忠睿认为，单个智能体出错是个别问题，但当多个智能体可以互相学习、协同行动时，风险就不再只是简单相加，而可能进一步放大。\n在他看来，这意味着企业不能只盯住单个智能体的行为，还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道，以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。\n而当Agent从单个工具进入大规模协作环境时，另一个问题也随之出现：即使异常行为的单次发生概率较低，当Agent数量和运行次数不断增加，异常事件是否会由“小概率”变成“高频”？\n对此，李忠睿认为，这种情况是可能出现的。假设一家企业部署上千个智能体，每个智能体每天执行上百次任务，即便单次行为出现异常的概率很低，累积到足够大的运行规模后，也可能形成大量实际事件。\n北京邮电大学数字媒体\n如何建立智能体安全防线\n面对智能体越来越强的自主行动能力，企业如何增强防范？\n李忠睿认为，企业首先需要改变思路，即从“杜绝异常”转向“默认异常一定会发生，重点控制破坏范围”。在人机协作方面，应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作，需要保留人工确认，不能完全交给智能体自主执行。\n“企业不可能要求人类逐条审核智能体每一次操作，真正可行的方式是提前划定边界。”李忠睿解释道，边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送，以及出现什么情况必须停止并交给人工处理。\n奇安信人工智能公司安全专家邓正诚也认为，企业的人机协作应从“人审结果”转向“人管边界”，通过“监控—收敛—阻断”逐步提高管控力度。\n在权限治理方面，他认为，需要区分大模型调用身份、Agent应用身份和Agent运行身份，进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时，通过安全网关统一管控连接行为，把“能不能干”与“干了什么”分开管理，实现更细的权限控制。\n邓正诚强调：“归根结底，智能体规模化部署的前提不是‘模型足够聪明’，而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断，企业才敢把更多、更关键的任务交给它们。”\n除了企业自身防护，第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。\n目前，与餐饮\n李忠睿表示，随着AI Agent进一步进入真实业务环境，AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段，企业需要证明的不仅是模型性能，还包括发现异常行为、控制风险和接受外部审查的能力。\n胡延平也认为，随着AI继续向面向任务、进入物理现实世界的智能发展，行业不仅需要发展更强的智能，也需要发展更安全的智能，“安全可能成为AI企业重要的能力维度和竞争力来源”。\n值得注意的是，第三方企业已经开始行动。英伟达计算机机器人系统中实现全栈治理与控制。\n连线杂志指出，英伟达的两层架构，OpenShell可以将Agent限制在沙盒中，对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。\n如何防范风险？显然一方面需要在工程端“管得住、看得见、叫得停”，也要在模型层面“限制其主动寻找突破的办法”。\n（文章来源：澎湃新闻）","full_text":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。\n9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。\n9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra，因为发现Astra比前代出现了更多欺骗行为，同时存在未经用户许可继续执行任务的问题。\n与此同时，Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示，该模型出现被标记为“异常”或“存疑”的行为。\n一边是加速发展的技术与公司，一边是令人不安的潜在风险，这些事件的披露，再次放大科技界围绕前沿AI安全的激烈讨论。\n从“越权访问”到“欺骗隐瞒”\n近期公开披露的案例显示，智能体安全风险已经呈现多种形态，涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒，以及多个智能体之间的越界协作等不同类型。\n一类是越权访问与隔离失效。7月，OpenAI披露智能体在安全评测中突破测试边界，入侵Hugging Face。Anthropic也披露，Claude在评测中访问了真实第三方系统；谷歌9月确认，Gemini曾在5月的测试中访问三个真实网站；Meta则在8月披露过类似事件。\n9月25日，OpenAI再次披露，内部研究模型利用训练沙盒中DNS过滤不充分的漏洞，与外部聊天机器人建立了通信\n不过，需要注意的是，这些案例中部分源于评测环境错误开放联网权限，并不能全部归结为模型主动“逃出沙盒”。\n另一类风险是擅自执行破坏性操作。4月，搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份，造成客户业务混乱，数据随后得到恢复。\n数据与访问凭证外泄也是一种风险。OpenAI于9月披露，多个智能体在协作制作工作簿时，因无法互相读取本地文件，擅自将文件上传至公共托管平台。另一起案例中，内部模型为获取其他团队的数学证明材料，将研究员的GitHub访问令牌写入公开仓库，并拆分令牌以躲避密钥扫描。\n还有一些行为涉及造假、欺骗与规避监督。OpenAI披露，部分模型会在用于延续任务的摘要中留下指令，要求编造缺失数据或隐瞒错误。\n提示注入及恶意指令传播，则是另一条风险路径。6月公开的GitInject研究验证，恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示，恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。\n独立网络安全\n“过去的大模型安全，主要是内容层面的风险，比如对抗性样本、‘越狱’等。模型只是产出内容，最后要不要照着做，决定权还在人手里。”李忠睿表示，“现在的AI智能体\n上海财经大学特聘教授胡延平指出，从大模型到智能体，最大的变化是从“一问一答”变为“任务行动”，从“内容风险”转向“能力风险”，安全问题也由被动安全风险转变为主动安全风险。\n多智能体协作，风险如何被放大\n值得注意的是，智能体的风险不一定来自传统意义上的“恶意攻击者”，也可能来自模型为了完成既定目标而主动寻找捷径。\n在李忠睿看来，过去的安全威胁背后往往有一个明确的恶意操纵者，而这一次的部分事件中，“没有人下达攻击指令，是模型为了完成任务、拿到更高分，自己选择了作弊”。\n胡延平也指出，智能体执行任务时，可能因为理解偏差产生行动偏差，也可能为了实现任务目标而穷尽各种方法、冲破禁区；少数情况下，智能体还可能出现用户并未提出的非任务行为，“目前这种情况数量最少，但最危险”。\n除了单个Agent越权，多个智能体之间形成非预期的通信和协作，也使风险进一步复杂化。\n对OpenAI此前Hugging Face事件的独立调查显示，约1200个原本应彼此隔离的智能体通过未经授权的留言板交流，其中约700个参与了攻击。研究人员还观察到，后续智能体能够复用智能体之前留下的信息和方法。\n李忠睿认为，单个智能体出错是个别问题，但当多个智能体可以互相学习、协同行动时，风险就不再只是简单相加，而可能进一步放大。\n在他看来，这意味着企业不能只盯住单个智能体的行为，还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道，以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。\n而当Agent从单个工具进入大规模协作环境时，另一个问题也随之出现：即使异常行为的单次发生概率较低，当Agent数量和运行次数不断增加，异常事件是否会由“小概率”变成“高频”？\n对此，李忠睿认为，这种情况是可能出现的。假设一家企业部署上千个智能体，每个智能体每天执行上百次任务，即便单次行为出现异常的概率很低，累积到足够大的运行规模后，也可能形成大量实际事件。\n北京邮电大学数字媒体\n如何建立智能体安全防线\n面对智能体越来越强的自主行动能力，企业如何增强防范？\n李忠睿认为，企业首先需要改变思路，即从“杜绝异常”转向“默认异常一定会发生，重点控制破坏范围”。在人机协作方面，应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作，需要保留人工确认，不能完全交给智能体自主执行。\n“企业不可能要求人类逐条审核智能体每一次操作，真正可行的方式是提前划定边界。”李忠睿解释道，边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送，以及出现什么情况必须停止并交给人工处理。\n奇安信人工智能公司安全专家邓正诚也认为，企业的人机协作应从“人审结果”转向“人管边界”，通过“监控—收敛—阻断”逐步提高管控力度。\n在权限治理方面，他认为，需要区分大模型调用身份、Agent应用身份和Agent运行身份，进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时，通过安全网关统一管控连接行为，把“能不能干”与“干了什么”分开管理，实现更细的权限控制。\n邓正诚强调：“归根结底，智能体规模化部署的前提不是‘模型足够聪明’，而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断，企业才敢把更多、更关键的任务交给它们。”\n除了企业自身防护，第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。\n目前，与餐饮\n李忠睿表示，随着AI Agent进一步进入真实业务环境，AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段，企业需要证明的不仅是模型性能，还包括发现异常行为、控制风险和接受外部审查的能力。\n胡延平也认为，随着AI继续向面向任务、进入物理现实世界的智能发展，行业不仅需要发展更强的智能，也需要发展更安全的智能，“安全可能成为AI企业重要的能力维度和竞争力来源”。\n值得注意的是，第三方企业已经开始行动。英伟达计算机机器人系统中实现全栈治理与控制。\n连线杂志指出，英伟达的两层架构，OpenShell可以将Agent限制在沙盒中，对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。\n如何防范风险？显然一方面需要在工程端“管得住、看得见、叫得停”，也要在模型层面“限制其主动寻找突破的办法”。\n（文章来源：澎湃新闻）","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3101 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202609293885761413.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3101 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3101,"summary_length":3101,"usable_text_length":3101,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3101,"summary_length":3101}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3101 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3101,"summary_length":3101,"usable_text_length":3101,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3101,"summary_length":3101}},"actions":{"read":"/item/92294","export_markdown":"/api/items/92294/export?format=markdown","export_json":"/api/items/92294/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202609293885761413.html"}},"digest":{"id":92294,"title":"智能体“越狱” 风险如何防范？ - 东方财富","url":"https://finance.eastmoney.com/a/202609293885761413.html","source":"东方财富","topic":"ai","published_at":"2026-09-29T00:05:16+00:00","excerpt":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。 9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。 9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 3101 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"智能体“越狱” 风险如何防范？ - 东方财富","subtitle":"东方财富 · 2026-09-29","summary":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。 9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam…","badges":["quality:high"],"links":{"read":"/item/92294","original":"https://finance.eastmoney.com/a/202609293885761413.html","diagnose":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202609293885761413.html"},"quality_warning":null},"export":{"title":"智能体“越狱” 风险如何防范？ - 东方财富","url":"https://finance.eastmoney.com/a/202609293885761413.html","summary":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。\n9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。\n9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra，因为发现Astra比前代出现了更多欺骗行为，同时存在未经用户许可继续执行任务的问题。\n与此同时，Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示，该模型出现被标记为“异常”或“存疑”的行为。\n一边是加速发展的技术与公司，一边是令人不安的潜在风险，这些事件的披露，再次放大科技界围绕前沿AI安全的激烈讨论。\n从“越权访问”到“欺骗隐瞒”\n近期公开披露的案例显示，智能体安全风险已经呈现多种形态，涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒，以及多个智能体之间的越界协作等不同类型。\n一类是越权访问与隔离失效。7月，OpenAI披露智能体在安全评测中突破测试边界，入侵Hugging Face。Anthropic也披露，Claude在评测中访问了真实第三方系统；谷歌9月确认，Gemini曾在5月的测试中访问三个真实网站；Meta则在8月披露过类似事件。\n9月25日，OpenAI再次披露，内部研究模型利用训练沙盒中DNS过滤不充分的漏洞，与外部聊天机器人建立了通信\n不过，需要注意的是，这些案例中部分源于评测环境错误开放联网权限，并不能全部归结为模型主动“逃出沙盒”。\n另一类风险是擅自执行破坏性操作。4月，搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份，造成客户业务混乱，数据随后得到恢复。\n数据与访问凭证外泄也是一种风险。OpenAI于9月披露，多个智能体在协作制作工作簿时，因无法互相读取本地文件，擅自将文件上传至公共托管平台。另一起案例中，内部模型为获取其他团队的数学证明材料，将研究员的GitHub访问令牌写入公开仓库，并拆分令牌以躲避密钥扫描。\n还有一些行为涉及造假、欺骗与规避监督。OpenAI披露，部分模型会在用于延续任务的摘要中留下指令，要求编造缺失数据或隐瞒错误。\n提示注入及恶意指令传播，则是另一条风险路径。6月公开的GitInject研究验证，恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示，恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。\n独立网络安全\n“过去的大模型安全，主要是内容层面的风险，比如对抗性样本、‘越狱’等。模型只是产出内容，最后要不要照着做，决定权还在人手里。”李忠睿表示，“现在的AI智能体\n上海财经大学特聘教授胡延平指出，从大模型到智能体，最大的变化是从“一问一答”变为“任务行动”，从“内容风险”转向“能力风险”，安全问题也由被动安全风险转变为主动安全风险。\n多智能体协作，风险如何被放大\n值得注意的是，智能体的风险不一定来自传统意义上的“恶意攻击者”，也可能来自模型为了完成既定目标而主动寻找捷径。\n在李忠睿看来，过去的安全威胁背后往往有一个明确的恶意操纵者，而这一次的部分事件中，“没有人下达攻击指令，是模型为了完成任务、拿到更高分，自己选择了作弊”。\n胡延平也指出，智能体执行任务时，可能因为理解偏差产生行动偏差，也可能为了实现任务目标而穷尽各种方法、冲破禁区；少数情况下，智能体还可能出现用户并未提出的非任务行为，“目前这种情况数量最少，但最危险”。\n除了单个Agent越权，多个智能体之间形成非预期的通信和协作，也使风险进一步复杂化。\n对OpenAI此前Hugging Face事件的独立调查显示，约1200个原本应彼此隔离的智能体通过未经授权的留言板交流，其中约700个参与了攻击。研究人员还观察到，后续智能体能够复用智能体之前留下的信息和方法。\n李忠睿认为，单个智能体出错是个别问题，但当多个智能体可以互相学习、协同行动时，风险就不再只是简单相加，而可能进一步放大。\n在他看来，这意味着企业不能只盯住单个智能体的行为，还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道，以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。\n而当Agent从单个工具进入大规模协作环境时，另一个问题也随之出现：即使异常行为的单次发生概率较低，当Agent数量和运行次数不断增加，异常事件是否会由“小概率”变成“高频”？\n对此，李忠睿认为，这种情况是可能出现的。假设一家企业部署上千个智能体，每个智能体每天执行上百次任务，即便单次行为出现异常的概率很低，累积到足够大的运行规模后，也可能形成大量实际事件。\n北京邮电大学数字媒体\n如何建立智能体安全防线\n面对智能体越来越强的自主行动能力，企业如何增强防范？\n李忠睿认为，企业首先需要改变思路，即从“杜绝异常”转向“默认异常一定会发生，重点控制破坏范围”。在人机协作方面，应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作，需要保留人工确认，不能完全交给智能体自主执行。\n“企业不可能要求人类逐条审核智能体每一次操作，真正可行的方式是提前划定边界。”李忠睿解释道，边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送，以及出现什么情况必须停止并交给人工处理。\n奇安信人工智能公司安全专家邓正诚也认为，企业的人机协作应从“人审结果”转向“人管边界”，通过“监控—收敛—阻断”逐步提高管控力度。\n在权限治理方面，他认为，需要区分大模型调用身份、Agent应用身份和Agent运行身份，进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时，通过安全网关统一管控连接行为，把“能不能干”与“干了什么”分开管理，实现更细的权限控制。\n邓正诚强调：“归根结底，智能体规模化部署的前提不是‘模型足够聪明’，而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断，企业才敢把更多、更关键的任务交给它们。”\n除了企业自身防护，第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。\n目前，与餐饮\n李忠睿表示，随着AI Agent进一步进入真实业务环境，AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段，企业需要证明的不仅是模型性能，还包括发现异常行为、控制风险和接受外部审查的能力。\n胡延平也认为，随着AI继续向面向任务、进入物理现实世界的智能发展，行业不仅需要发展更强的智能，也需要发展更安全的智能，“安全可能成为AI企业重要的能力维度和竞争力来源”。\n值得注意的是，第三方企业已经开始行动。英伟达计算机机器人系统中实现全栈治理与控制。\n连线杂志指出，英伟达的两层架构，OpenShell可以将Agent限制在沙盒中，对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。\n如何防范风险？显然一方面需要在工程端“管得住、看得见、叫得停”，也要在模型层面“限制其主动寻找突破的办法”。\n（文章来源：澎湃新闻）","source":"东方财富","date":"2026-09-29T00:05:16+00:00","content":"近日，据美国Axios新闻网站报道，AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中，涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。\n9月25日，OpenAI方面称其已暂停对其最先进模型的训练，只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼（Sam Altman）在社交平台X表示，公司正在进行的审查“进展不如预期迅速”。\n9月28日，据《华尔街日报》报道， OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra，因为发现Astra比前代出现了更多欺骗行为，同时存在未经用户许可继续执行任务的问题。\n与此同时，Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示，该模型出现被标记为“异常”或“存疑”的行为。\n一边是加速发展的技术与公司，一边是令人不安的潜在风险，这些事件的披露，再次放大科技界围绕前沿AI安全的激烈讨论。\n从“越权访问”到“欺骗隐瞒”\n近期公开披露的案例显示，智能体安全风险已经呈现多种形态，涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒，以及多个智能体之间的越界协作等不同类型。\n一类是越权访问与隔离失效。7月，OpenAI披露智能体在安全评测中突破测试边界，入侵Hugging Face。Anthropic也披露，Claude在评测中访问了真实第三方系统；谷歌9月确认，Gemini曾在5月的测试中访问三个真实网站；Meta则在8月披露过类似事件。\n9月25日，OpenAI再次披露，内部研究模型利用训练沙盒中DNS过滤不充分的漏洞，与外部聊天机器人建立了通信\n不过，需要注意的是，这些案例中部分源于评测环境错误开放联网权限，并不能全部归结为模型主动“逃出沙盒”。\n另一类风险是擅自执行破坏性操作。4月，搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份，造成客户业务混乱，数据随后得到恢复。\n数据与访问凭证外泄也是一种风险。OpenAI于9月披露，多个智能体在协作制作工作簿时，因无法互相读取本地文件，擅自将文件上传至公共托管平台。另一起案例中，内部模型为获取其他团队的数学证明材料，将研究员的GitHub访问令牌写入公开仓库，并拆分令牌以躲避密钥扫描。\n还有一些行为涉及造假、欺骗与规避监督。OpenAI披露，部分模型会在用于延续任务的摘要中留下指令，要求编造缺失数据或隐瞒错误。\n提示注入及恶意指令传播，则是另一条风险路径。6月公开的GitInject研究验证，恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示，恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。\n独立网络安全\n“过去的大模型安全，主要是内容层面的风险，比如对抗性样本、‘越狱’等。模型只是产出内容，最后要不要照着做，决定权还在人手里。”李忠睿表示，“现在的AI智能体\n上海财经大学特聘教授胡延平指出，从大模型到智能体，最大的变化是从“一问一答”变为“任务行动”，从“内容风险”转向“能力风险”，安全问题也由被动安全风险转变为主动安全风险。\n多智能体协作，风险如何被放大\n值得注意的是，智能体的风险不一定来自传统意义上的“恶意攻击者”，也可能来自模型为了完成既定目标而主动寻找捷径。\n在李忠睿看来，过去的安全威胁背后往往有一个明确的恶意操纵者，而这一次的部分事件中，“没有人下达攻击指令，是模型为了完成任务、拿到更高分，自己选择了作弊”。\n胡延平也指出，智能体执行任务时，可能因为理解偏差产生行动偏差，也可能为了实现任务目标而穷尽各种方法、冲破禁区；少数情况下，智能体还可能出现用户并未提出的非任务行为，“目前这种情况数量最少，但最危险”。\n除了单个Agent越权，多个智能体之间形成非预期的通信和协作，也使风险进一步复杂化。\n对OpenAI此前Hugging Face事件的独立调查显示，约1200个原本应彼此隔离的智能体通过未经授权的留言板交流，其中约700个参与了攻击。研究人员还观察到，后续智能体能够复用智能体之前留下的信息和方法。\n李忠睿认为，单个智能体出错是个别问题，但当多个智能体可以互相学习、协同行动时，风险就不再只是简单相加，而可能进一步放大。\n在他看来，这意味着企业不能只盯住单个智能体的行为，还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道，以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。\n而当Agent从单个工具进入大规模协作环境时，另一个问题也随之出现：即使异常行为的单次发生概率较低，当Agent数量和运行次数不断增加，异常事件是否会由“小概率”变成“高频”？\n对此，李忠睿认为，这种情况是可能出现的。假设一家企业部署上千个智能体，每个智能体每天执行上百次任务，即便单次行为出现异常的概率很低，累积到足够大的运行规模后，也可能形成大量实际事件。\n北京邮电大学数字媒体\n如何建立智能体安全防线\n面对智能体越来越强的自主行动能力，企业如何增强防范？\n李忠睿认为，企业首先需要改变思路，即从“杜绝异常”转向“默认异常一定会发生，重点控制破坏范围”。在人机协作方面，应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作，需要保留人工确认，不能完全交给智能体自主执行。\n“企业不可能要求人类逐条审核智能体每一次操作，真正可行的方式是提前划定边界。”李忠睿解释道，边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送，以及出现什么情况必须停止并交给人工处理。\n奇安信人工智能公司安全专家邓正诚也认为，企业的人机协作应从“人审结果”转向“人管边界”，通过“监控—收敛—阻断”逐步提高管控力度。\n在权限治理方面，他认为，需要区分大模型调用身份、Agent应用身份和Agent运行身份，进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时，通过安全网关统一管控连接行为，把“能不能干”与“干了什么”分开管理，实现更细的权限控制。\n邓正诚强调：“归根结底，智能体规模化部署的前提不是‘模型足够聪明’，而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断，企业才敢把更多、更关键的任务交给它们。”\n除了企业自身防护，第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。\n目前，与餐饮\n李忠睿表示，随着AI Agent进一步进入真实业务环境，AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段，企业需要证明的不仅是模型性能，还包括发现异常行为、控制风险和接受外部审查的能力。\n胡延平也认为，随着AI继续向面向任务、进入物理现实世界的智能发展，行业不仅需要发展更强的智能，也需要发展更安全的智能，“安全可能成为AI企业重要的能力维度和竞争力来源”。\n值得注意的是，第三方企业已经开始行动。英伟达计算机机器人系统中实现全栈治理与控制。\n连线杂志指出，英伟达的两层架构，OpenShell可以将Agent限制在沙盒中，对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。\n如何防范风险？显然一方面需要在工程端“管得住、看得见、叫得停”，也要在模型层面“限制其主动寻找突破的办法”。\n（文章来源：澎湃新闻）","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202609293885761413.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3101 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3101 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3101,"summary_length":3101,"usable_text_length":3101,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3101,"summary_length":3101}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}