蚂蚁开源大模型安全内生护栏SingProbe Infra,已适配29个主流开源模型

栏目:互联网 | 来源:智东西 | 2026-09-16 19:42

2026国家网络安全宣传周期间,蚂蚁AI安全实验室宣布开源大模型内生式安全护栏SingProbe,同步开放相关代码、模型和评测基准,为开发者提供与模型生成过程同步运行的安全检测能力。

目前,SingProbe已适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源大模型,并接入SGLang、vLLM推理框架,支持开发者在现有推理流程中集成安全防护。

随着大模型进入日常问答、办公辅助、客户服务等业务场景,开发者既需要关注回答质量,也需要及时发现不安全内容和编造信息。

例如,AI在健康咨询中可能给出不恰当的用药建议,在资料问答中可能编造不存在的文献。如何兼顾风险检测、响应速度和部署成本,成为大模型应用落地的重要问题。

目前,大模型应用通常通过独立的外置护栏模型审核输入或输出。这种方式通用、直接,但需要额外处理待审核内容,增加计算和部署成本。如果等待完整回答生成后再检查,风险信号可能来得太晚;如果提高检查频率,又会进一步增加运行负担。

运行时探针是学界探索兼顾安全检测效果与运行效率的一条技术路径,但从研究走向实际应用,还需要模型适配、推理框架集成等工程支持。

SingProbe通过适配多种开源模型、接入主流推理框架,补充了相关部署能力,让开发者更方便地将内生式安全护栏接入实际业务。

运行时探针是学界探索兼顾安全检测效果与运行效率的一种护栏方案。

但由于缺乏配套基础设施支持,相关研究成果在实际落地中仍面临障碍,应用端仍更多采用外置护栏。SingProbe通过提供模型适配、推理框架集成等工程支持,让开发者更方便地将内生式安全护栏接入实际业务。

SingProbe如同一个模型内的“安全探头”,通过复用大模型推理过程中已经产生的内部信息,持续输出用户意图、回答安全和幻觉风险分数。

模型一边生成回答,探针一边提供风险信号,应用系统无需等待整段回答结束,就可以据此采取告警、中止回答、重新生成等措施。

据研发团队在Ling-3.0-flash模型生产环境中的实测,SingProbe在解码阶段引入的额外开销低于0.5%。

团队评测显示,flash版本在回答安全分类和流式安全检测任务上超过所选公开基线,在幻觉检测任务上与参考基线基本持平,展现出兼顾检测能力与运行效率的潜力。

此次同步开放的流式安全评测基准SingStreamBench,进一步关注风险出现和被发现的具体时刻。它不仅检验护栏能否识别风险,还考察是否过早触发、发现是否及时,帮助开发者评估安全防护效果及其对正常回答的影响。

在风险识别之外,团队还探索了如何利用风险信号进行按需纠偏。作为一项场景验证,SingProbe-Med在医疗内容生成过程中,仅在风险达到触发条件后,对局部高风险内容进行干预。

在AntAngelMed-100B的医疗评测中,完整干预能够纠正基线模型中25.03%原本出错的回答,展示了内生风险信号用于生成过程安全控制的潜力。

通过此次开源,开发者可以获取代码与集成说明、模型及评测资源,开展部署、测试和进一步适配。SingProbe既可独立使用,也可与外置护栏配合。

后续,团队将逐步扩展对更多开源模型的支持,并邀请开发者、研究者和产业伙伴参与试用反馈,共同完善大模型生成过程中的安全防护能力。

项目代码与集成说明已在GitHub开放,相关模型及SingStreamBench评测基准可通过Hugging Face获取。

了解更多

猜你想看

← 返回首页