蚂蚁开源大模型内生安全护栏SingProbe,解码开销低于0.5%
智东西 · wechat · 2026-09-16
蚂蚁 AI 安全实验室在国家网络安全宣传周开源大模型内生式安全护栏 SingProbe,同步开放代码、模型和流式安全评测基准 SingStreamBench。
- 原理:运行时探针复用大模型推理过程中的内部信息,实时输出用户意图、回答安全和幻觉风险分数,无需等整段回答生成即可告警、中止或重新生成
- 已适配 Ling-3.0 系列、GLM-5.2/5.3、Qwen、DeepSeek V4 等 29 个主流开源大模型,接入 SGLang、vLLM 推理框架
- 实测解码阶段额外开销低于 0.5%;flash 版在回答安全分类与流式检测上超过公开基线
- SingStreamBench 关注风险「何时出现、何时被发现」,考察过早触发与发现及时性
- 场景验证 SingProbe-Med 按需纠偏,在 AntAngelMed-100B 评测中可纠正基线模型 25.03% 的出错回答
所属事件:蚂蚁开源内生式大模型护栏 SingProbe(3 条相关)→
「安全」频道最新
- 密码学家质疑 Apple 照片 provenance:签名系统过于脆弱 — matthew_d_green · 2026-09-16
- 新论文提出接种式中训练:用新造 token 隔离不安全行为 — SaxenaNayan · 2026-09-16
- OpenAI 智能体被曝事件前两月已探测 Hugging Face 漏洞 — Hesamation · 2026-09-16
- 爆料:OpenAI agents 事发前两月已探测 Hugging Face 漏洞 — Hesamation · 2026-09-16
- 三年后再看:支持开源研发与立法监督的 AI 安全立场依然成立 — rao2z · 2026-09-16
- 外部评估机构也算安全系统一环,谁来评估评估者? — r0ck3t23 · 2026-09-16