{"id":81959,"topic":"ai","source":"Sohu","title":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏” - Sohu","url":"https://m.sohu.com/a/1075938321_120109837?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","url_hash":"538240dcbbb6afc314d90015f18e35b106074bf6","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMijAFBVV95cUxOdVNjdGRTWGJKc1lPVlN6am9IYkJGR1hvVjBUTUptWk1qM0NxckctNkNkdmYwaHZkeVlWY1RUaUZHNkxEWWpXWmowRWNhbHlpUUdtVzVUeGJEUy1scmkybndxYl94cjlLVU5xU1BudEtCVktXdV9GcHNfYjIzMEVnTm5Fendlb3FBd09yQw?oc=5\" target=\"_blank\">让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">Sohu</font>","content":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”\n【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。\n当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。\n这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。\nSingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。\n从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。\n值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。\n责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝","image_url":"//q9.itc.cn/q_70/images03/20260914/c83dda5ed00b40219286d4bb8d44d548.jpeg","lang":"zh","published_at":"2026-09-14T10:12:03+00:00","fetched_at":"2026-09-14T11:15:09+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”\n【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。\n当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。\n这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。\nSingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。\n从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。\n值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。\n责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝","cluster_id":3530369,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://m.sohu.com/a/1075938321_120109837?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 722 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":722,"summary_length":722,"usable_text_length":722,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":722,"summary_length":722}},"news_item":{"id":81959,"canonical_url":"https://m.sohu.com/a/1075938321_120109837?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source_url":"https://m.sohu.com/a/1075938321_120109837?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","title":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏” - Sohu","source_name":"Sohu","author":null,"published_at":"2026-09-14T10:12:03+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMijAFBVV95cUxOdVNjdGRTWGJKc1lPVlN6am9IYkJGR1hvVjBUTUptWk1qM0NxckctNkNkdmYwaHZkeVlWY1RUaUZHNkxEWWpXWmowRWNhbHlpUUdtVzVUeGJEUy1scmkybndxYl94cjlLVU5xU1BudEtCVktXdV9GcHNfYjIzMEVnTm5Fendlb3FBd09yQw?oc=5\" target=\"_blank\">让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">Sohu</font>","full_text":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”\n【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。\n当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。\n这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。\nSingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。\n从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。\n值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。\n责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝","excerpt":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”\n【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。\n当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。\n这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。\nSingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。\n从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。\n值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。\n责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 722 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1075938321_120109837%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 722 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":722,"summary_length":722,"usable_text_length":722,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":722,"summary_length":722}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏” - Sohu","url":"https://m.sohu.com/a/1075938321_120109837?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”\n【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。\n当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。\n这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。\nSingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。\n从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。\n值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。\n责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝","source":"Sohu","date":"2026-09-14T10:12:03+00:00","content":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”\n【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。\n当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。\n这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。\nSingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。\n从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。\n值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。\n责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1075938321_120109837%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 722 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 722 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":722,"summary_length":722,"usable_text_length":722,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":722,"summary_length":722}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/81959","export_markdown":"/api/items/81959/export?format=markdown","export_json":"/api/items/81959/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1075938321_120109837%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"formats":{"full":{"id":81959,"title":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏” - Sohu","url":"https://m.sohu.com/a/1075938321_120109837?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"Sohu","author":null,"published_at":"2026-09-14T10:12:03+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”\n【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。\n当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。\n这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。\nSingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。\n从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。\n值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。\n责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝","full_text":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”\n【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。\n当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。\n这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。\nSingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。\n从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。\n值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。\n责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 722 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1075938321_120109837%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 722 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":722,"summary_length":722,"usable_text_length":722,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":722,"summary_length":722}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 722 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":722,"summary_length":722,"usable_text_length":722,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":722,"summary_length":722}},"actions":{"read":"/item/81959","export_markdown":"/api/items/81959/export?format=markdown","export_json":"/api/items/81959/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1075938321_120109837%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"}},"digest":{"id":81959,"title":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏” - Sohu","url":"https://m.sohu.com/a/1075938321_120109837?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"Sohu","topic":"ai","published_at":"2026-09-14T10:12:03+00:00","excerpt":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏” 【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。 当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 722 characters.","reading_time_min":1,"cluster_id":3530369},"card":{"display_title":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏” - Sohu","subtitle":"Sohu · 2026-09-14","summary":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏” 【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。…","badges":["quality:high"],"links":{"read":"/item/81959","original":"https://m.sohu.com/a/1075938321_120109837?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1075938321_120109837%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"quality_warning":null},"export":{"title":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏” - Sohu","url":"https://m.sohu.com/a/1075938321_120109837?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”\n【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。\n当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。\n这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。\nSingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。\n从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。\n值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。\n责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝","source":"Sohu","date":"2026-09-14T10:12:03+00:00","content":"让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”\n【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。\n当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。\n这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。\nSingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。\n从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。\n值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。\n责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1075938321_120109837%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 722 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 722 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":722,"summary_length":722,"usable_text_length":722,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":722,"summary_length":722}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}