蚂蚁AI安全实验室发布并开源大模型内生式安全护栏SingProbe。该方案复用推理内部表征,将实时安全检测的算力开销降至0.5%以下,并在医疗场景成功纠偏25%的错误回答,有效破解流式生成审核延迟的难题。
随着大语言模型深度融入日常对话、办公辅助与客服场景,生成内容的安全性与真实性变得至关重要。如何在不损害推理速度和交互体验的前提下,快速拦截恶意内容并抑制幻觉,成为大模型规模化落地的核心技术瓶颈。
国家网络安全宣传周期间,蚂蚁AI安全实验室正式开源大模型内生式安全护栏方案 SingProbe。该技术将安全风险检测直接融入模型生成过程,构建起常驻模型内部的“安全探头”,以极低的计算开销实现实时的流式风险预警。

传统的大模型安全防护主要依赖独立的外置护栏模型,分别在输入阶段或完整输出后进行审查。这种外挂模式虽然部署直接,但缺点十分明显:不仅带来额外的算力与显存开销,还会造成明显的响应延迟。若等待回答全部生成后再行阻断,违规内容往往已被流式传输呈现给终端用户;若频繁对中间片段切片审核,系统推理吞吐量又会断崖式下跌。
SingProbe 改变了这一路径。它不引入冗余的外部检查流程,而是直接复用主模型在推理过程中已经产生的内部隐藏状态与激活特征。通过挂载轻量级的安全检测头,系统在生成每一个 Token 的同时,即可实时输出风险概率评分。应用层能够据此动态选择静默告警、中断传输或触发重试。
根据研发团队在 Ling-3.0-flash 生产环境的测试数据,SingProbe 在解码阶段引入的额外延迟开销低于 0.5%。在回答安全性分类及流式安全检测任务上,该方案全面优于主流基准,并在幻觉检测上保持了高水准的判别精度。
为了精准衡量流式生成中的动态防护表现,研发团队同步开源了评测基准 SingStreamBench。该基准重点评估护栏在“模型由正常状态转向输出风险”关键时间节点的敏感度,综合考察风险识别的及时性与误报控制。
在容错率极低的垂直领域,团队进一步拓展了“即时干预”能力,推出医疗专项版本 SingProbe-Med。该机制在持续监测生成风险的同时,一旦触发阈值,即可对局部高危内容直接进行解码干预与重新采样。在 AntAngelMed-100B 医疗模型上的实测显示,该干预策略成功纠正了基线模型中 25.03% 的错误回答,展示了内生风险信号用于推理控制的实用价值。
目前,SingProbe 及其配套评测基准已全部开源,并已适配包括 Ling-3.0 系列、GLM-5.2/5.3、Qwen、DeepSeekV4 在内的 29 个主流开源大模型,深度整合至 vLLM 和 SGLang 等主流高性能推理引擎中,未来将进一步覆盖更多开源架构。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断