# 让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏” - Sohu

*Источник: Sohu*
*Дата: 2026-09-14*
*Язык: zh*

**Кратко:** 让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”
【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。
当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。
这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。
SingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。
从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。
值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。
责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝

让大模型“边生成边识别”风险，蚂蚁开源大模型“安全护栏”
【大河财立方 记者 陈薇】9月14日，蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。与主流的独立外挂审核模型不同，SingProbe复用基座模型推理过程中的隐藏状态，通过轻量探针在生成过程中逐token实时输出风险信号，额外开销不足0.5%，相关代码与模型已同步开源。
当前大模型安全护栏普遍采用外挂架构，在模型前后部署独立审核模块，对用户输入和模型输出各做一次完整推理。
这种方式代价是双倍计算成本，若等完整回答生成后再检查，风险内容可能已经被用户看到。而且外挂护栏模型，容量通常远小于基座模型，面对复杂内容时存在理解能力不匹配的问题，纠错可能会不准确。
SingProbe则直接读取大模型内部已产生的隐藏态，由仅数百万参数的轻量探针同步完成查询意图分类、内容安全与幻觉风险判定，实现“边生成边识别”，在风险内容完整输出前即可介入拦截。
从当下的技术路线看，外挂式仍是行业绝对主流，绿盟、百度、阿里、保旺达等国内厂商的安全护栏，以及国际上的Llama Guard 3、ShieldGemma等，均采用此架构。内生式则是近一年的新方向，学术界已有探索，但SingProbe是目前首个由大型科技公司开源、适配29个主流模型的完整方案。
值得注意的是，蚂蚁正加速布局医疗大模型等高风险场景。在健康咨询、用药建议等领域，模型输出的准确性与安全性直接关系到用户人身安全，对实时风险监测的需求尤为迫切。SingProbe的token级流式检测能力，恰好能在医疗问答生成过程中持续评估风险，及时阻断不当内容。
责编:陶纪燕 | 审校:张翼鹏 | 审核:李震 | 监审:古筝

[Оригинал](https://m.sohu.com/a/1075938321_120109837?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334)