2026-09-14 18:55
AI123

蚂蚁发布SingProbe:把安全检测嵌入大模型生成过程

国家网络安全宣传周期间,蚂蚁AI安全实验室发布大模型内生式安全护栏SingProbe,将安全检测融入模型生成过程,使大模型在生成回答的同时持续输出风险提示。SingProbe复用推理过程已产生的内部信息,通过轻量化模块输出风险分数,供系统及时中止回答、重新生成或告警。

当前大模型应用多通过外置护栏模型审核输入输出,虽通用直接,但会增加计算和部署成本。SingProbe让安全判断与生成同步进行。团队在Ling-3.0-flash生产环境实测,解码阶段额外开销低于0.5%;在回答安全分类和流式安全检测任务上超过所选公开基线,幻觉检测任务与参考基线基本持平。

此次同步发布面向流式生成场景的评测基准SingStreamBench,关注模型从正常回答转向风险内容的时刻,考察是否过早触发、发现是否及时。在医疗场景,团队提出SingProbe-Med,持续监测生成过程中的医疗风险,达到触发条件后对局部高风险内容进行解码干预。据AntAngelMed-100B医疗评测,完整干预可纠正基线模型25.03%原本出错的回答。

目前,SingProbe已适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源大模型,接入SGLang、vLLM推理框架,相关代码、模型和评测基准同步开源,后续将扩展对更多开源模型的支持。

来源
  1. 2026-09-14 18:41 | 新浪财经:蚂蚁发布大模型内生式安全护栏SingProbe,让AI边生成边识别风险
    阅读原文

    【环球网科技报道 记者 李文瑶】大模型正在进入日常问答、办公辅助、客户服务等真实业务场景。用户期待AI快速给出有用的回答,也需要这些回答安全、可靠。如何及时发现不安全内容和编造信息,同时减少安全审核对响应速度和用户体验的影响,成为大模型应用落地需要解决的问题。国家网络安全宣传周期间,蚂蚁AI安全实验室正式发布大模型内生式安全护栏SingProbe,将安全检测融入模型生成过程。它如同一个内置的“安全探头”,让AI一边生成回答,一边输出风险提示,以较低的额外计算开销,为大模型应用提供更及时的安全防护。 例如,用户向AI咨询健康问题时,会关心它是否给...

其他新闻

查看全部