蚂蚁开源 SingProbe:从 hidden states 实时读风险,流式护栏开销极低
aigclink · x · 2026-09-15
蚂蚁发布并开源内生式运行时护栏 SingProbe,区别于传统「外挂审核模型重读一遍」的做法(贵、慢、难处理复杂上下文)。
核心思路:
- 从主模型已有的 hidden states 中读风险信号,针对每个基座模型训练一个仅约 3–5M 参数的小探针
- 每个 token 输出多类分数:用户意图风险、已生成内容不安全、幻觉风险
- 只依赖当前已生成前缀,可流式实时预警,做到风险露头即告警、截断、重试或切换策略
已在 Ling-3.0-flash 生产环境 decode 阶段部署,额外开销极低。训练代码已开源(GitHub inclusionAI/SingProbe),基于冻结基座的多层 hidden states,通过 token-probe 补丁版 SGLang 实时导出隐状态流式训练,每 token 输出 10 维 logits,附技术报告。
所属事件:蚂蚁开源内生式 AI 护栏 SingProbe(2 条相关)→
「安全」频道最新
- 4 分钟视频解读:微软的 AI「宪法」是怎么写的 — Competitive_Travel16 · 2026-09-15
- Claude 文本暗藏隐形指纹,水印检测技术科普 — Two Minute Papers · 2026-09-15
- 美参议院拟授权政府审计员直接测试前沿模型危险能力 — VraserX · 2026-09-15
- 蚂蚁开源 SingProbe:从 hidden states 读风险的内生式 AI 护栏 — aigclink · 2026-09-15
- Reddit 讨论:反对 AI 减速的人到底反对什么? — nemzylannister · 2026-09-15
- 牛津报告:多数国际 AI 协议无需黑科技即可验证执行 — davidmanheim · 2026-09-15