蚂蚁开源 SingProbe:从 hidden states 读风险的内生式 AI 护栏

aigclink · x · 2026-09-15

蚂蚁发布并开源了一套内生式运行时护栏 SingProbe,与常见"外挂审核模型复读"方案不同,它从主模型的 hidden states 中读取风险信号,针对每个基座模型训练约 3–5M 参数的小探针,对每个 token 同步输出用户意图风险、已生成内容安全性和幻觉风险三类分数。

由于只依赖当前已生成前缀,SingProbe 可在流式 decode 阶段实时预警,风险刚露头即可触发截断、重试或切换策略;在 Ling-3.0-flash 生产环境的 decode 阶段额外开销小于 0.5%。在医疗场景的实测中,可现场纠正约 25% 的错误回答,且平时不全程干预,只在风险触发后的有限窗口内纠偏。

所属事件:蚂蚁开源内生式 AI 护栏 SingProbe(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →