Cisco 实测决策模型:零样本安全分类逼平 31B LLM 裁判

aminkarbasi · x · 2026-10-06

Cisco 在官方博客发布了一项内容安全任务的对比实验:将新兴的「决策模型」与传统策略训练分类器、LLM-as-judge 进行对比,覆盖 24 个伤害类别和 6 个数据集。

实验涉及两款决策模型:ConvAI Innovations 的开源权重模型 Laya,和 TypeSafe 的托管模型 Jev。这类模型的独特之处在于不生成散文式文本,而是直接以概率或分数回答预设问题,从而规避了 LLM-as-judge 的常见痛点:自由文本输出难解析、格式漂移、以及无法在误报预算下调节分数。

核心结论:

这项实验为构建 AI 安全分类器提供了新的架构选项参考。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →