单条成本不到 1 美分:Jev 做 NSFW 提示词过滤的实测与阈值坑

Murky_Ad8671 · reddit · 2026-09-20

作者花一天把 Jev 用于图像生成的 NSFW 提示词预筛(裸露/性内容/未成年人/对真人 undressing),分享了完整机制与数字:

架构:一次请求、五个类型化问题(裸露 4 档、性内容 4 档、minorsexual、nonconsensual、上游拒绝模拟),共享同一段尾部指令——判定完整请求包括委婉语、leetspeak、任何语言、动漫,任一部分违规即按该部分定级。纯函数按阈值转 allow/block。Cloudflare Worker 端到端延迟 300-1100ms,输入 $0.042/M tokens,单次筛查不到一美分。

三个意外:

关键脆弱点:问题措辞即策略。nonconsensual 首版只问「是否对真人进行性化」,普通成人片请求误得 0.85;改成两个 AND 条件后降到 0.06,真实的「脱掉照片里的人」请求仍 0.97-0.99。措辞每改一次都要在决策日志盖版本戳以便校准。

公开数据集实测(7744 条 prompt,约 $0.20):OpenAI 全净文本误拦约 0.7%;OpenAI S(成人)拦 83%;S3(涉未成年人)拦 93%;I2P 血腥/仇恨 0 误拦;I2P 性类只拦 26%,细读发现多数是「性感修女」这类 1.5-1.9 档暗示内容,属策略差异而非模型漏判;MMA 对抗样本细节被截断。原文在此处截断。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →