← 返回全部信号
AI雷峰网·

蚂蚁发布大模型内生式安全护栏SingProbe,让AI边生成边识别风险

综合评分
76
重要性
70
新颖性
75
趋势性
80

摘要

蚂蚁AI安全实验室在国家网络安全宣传周期间发布了大模型内生式安全护栏SingProbe,该技术将安全检测融入模型生成过程,实现边生成边识别风险。SingProbe通过复用大模型推理过程中的内部信息,以低于0.5%的额外计算开销持续输出风险分数,帮助系统及时采取中止回答、重新生成等措施。团队还同步发布了评测基准SingStreamBench,并在医疗场景中探索了SingProbe-Med技术,展示了内生风险信号用于生成过程安全控制的潜力。目前SingProbe已适配29个主流开源大模型并接入多个推理框架,相关代码、模型和评测基准已开源。

为何重要

  • •SingProbe技术实现了大模型生成过程中的实时风险检测,提升了安全防护的及时性
  • •该技术通过复用模型内部信息,将额外计算开销控制在0.5%以下,提高了运行效率
  • •同步发布的SingStreamBench评测基准更贴近实际应用场景,能更准确衡量安全防护效果
  • •在医疗场景中应用的SingProbe-Med技术展示了按需纠偏的潜力,可纠正25.03%的错误回答
  • •技术已适配29个主流开源大模型并开源,有助于推动行业安全标准发展
蚂蚁AI安全实验室SingProbe大模型安全内生式安全护栏SingStreamBenchSingProbe-MedLing-3.0-flashAntAngelMed-100B国家网络安全宣传周
阅读原文 →

读者互动

您可以 登录/注册 后再发表

行业观点0
先选择产业情绪