Cisco 实测决策模型:零样本安全分类逼平 31B LLM 裁判
aminkarbasi · x · 2026-10-06
Cisco 在官方博客发布了一项内容安全任务的对比实验:将新兴的「决策模型」与传统策略训练分类器、LLM-as-judge 进行对比,覆盖 24 个伤害类别和 6 个数据集。
实验涉及两款决策模型:ConvAI Innovations 的开源权重模型 Laya,和 TypeSafe 的托管模型 Jev。这类模型的独特之处在于不生成散文式文本,而是直接以概率或分数回答预设问题,从而规避了 LLM-as-judge 的常见痛点:自由文本输出难解析、格式漂移、以及无法在误报预算下调节分数。
核心结论:
- 针对特定策略训练的分类器仍然最有效;
- Jev 在零样本安全分类任务上意外接近 31B 参数的 LLM 裁判表现。
这项实验为构建 AI 安全分类器提供了新的架构选项参考。
「安全」频道最新
- 网站反爬升级致 AI 浏览器用例骤减,x402 付费通行或成出路 — kleffew94 · 2026-10-06
- 研究称先进 AI 可隐藏思维链并骗过监控,Hugging Face 蜂群实验 14 条启示 — RobbWiller · 2026-10-06
- 英国开发者给作品版权开价:一次性许可费 10 万英镑 — corvad · 2026-10-06
- Stanford HAI 质疑基准分数:LLM 多语言安全研究将亮相 COLM 2026 — zeeshanp_ · 2026-10-06
- 澳洲工会与顶级 AI 研究机构联合呼吁建设主权 AI 能力 — TobyWalsh · 2026-10-06
- 纽约州议员指控 OpenAI 在 RAISE Act 听证中宣誓后翻供涉伪证 — DavidSKrueger · 2026-10-06