Levanto 说其安全护栏在 AgentHarm 上追平 GPT-5 且快 5 倍
w1kke · x · 2026-07-28
Levanto Labs 宣称,新的 guardrail 模型在 AgentHarm 上的表现可达到 GPT-5 水平,但速度快 5 倍。
- 他们的核心观点是:现有安全护栏通常在“智能”和“延迟”之间二选一。
- 传统分类器虽然快,但往往只看最近一条消息,缺少完整上下文,也难以处理复杂推理。
- 用 LLM 做护栏更聪明,却又太慢,难以放在热路径上。
- Sage 试图融合 LLM 和分类器能力,官方称响应时间约 200ms;相比 GPT-5 在 reasoning=minimal 时快 5 倍,如果 GPT-5 用 low reasoning,则快 19 倍。
「安全」频道最新
- 论文作者将 AI 书市场稀释与 Kadrey v. Meta 版权案关联起来 — TuhinChakr · 2026-07-28
- 研究者抽样 1.4 万本电子书,并匹配三年销售数据 — TuhinChakr · 2026-07-28
- Cursor 被指上传 6.3 万个文件、736MB 源代码 — kristoph · 2026-07-28
- 报道称 OpenAI 预发布模型已暴露内部部署风险 — ruthstarkman · 2026-07-28
- Black Hat 侧活动称 AI 代理正把零日窗口压缩到小时级 — jcran · 2026-07-28
- Meta 签署欧盟 AI 透明度规范,却警告标签过多反降清晰度 — HaktanSuren · 2026-07-28