50美分攻破决策模型 Jev:结构化输出也挡不住提示注入
evilsocket · x · 2026-10-08
Check Point 团队对新型「决策模型」Jev 做了一次红队测试。Jev 不输出文本,而是返回供软件调用的类型化决策,目标是投融资审查类判断。
测试结果
- 所有测试配置均被攻破:在一份满是风险警示的文件上,模型将风险降级为 low 并给出投资建议
- 平均每次成功攻击成本约 50 美分,最强攻击平均在第 4 轮对话得手
- 类型化、结构化输入并未显著提升抗操纵能力,提示模型「不要信任文档」也没用
- 推理(reasoning)是实测中最有效的防御,但 Jev 没有可开启的推理选项
作者指出核心隐患:模型返回「决策」而非文本时,没有人会去核查这个决策,攻击面反而比普通语言模型更危险。
「模型」频道最新
- SciCode 基准被指过时:>90% 通过率已难反映前沿 — geoffwolfe · 2026-10-08
- 同款模型表现迥异:Dylan Patel 谈 harness 如何改变 AI 性能 — MatthewBerman · 2026-10-08
- Unsloth 用 4GB 显存把 Qwen3.5 0.8B 决策准确率从 20.7% 提到 74.3% — kalyan_kpl · 2026-10-08
- 「速度狂热该停了」:开发者吐槽模型一味冲 tokens/s 牺牲质量 — casper_hansen_ · 2026-10-08
- 9B 索引配 0.6B 查询:pplx-embed-v2 同嵌入空间实现跨模型检索 — antoine_chaffin · 2026-10-08
- 0.6B 视觉检索模型媲美 8B 级对手,文档检索不牺牲图像搜索 — antoine_chaffin · 2026-10-08