单条成本不到 1 美分:Jev 做 NSFW 提示词过滤的实测与阈值坑
Murky_Ad8671 · reddit · 2026-09-20
作者花一天把 Jev 用于图像生成的 NSFW 提示词预筛(裸露/性内容/未成年人/对真人 undressing),分享了完整机制与数字:
架构:一次请求、五个类型化问题(裸露 4 档、性内容 4 档、minorsexual、nonconsensual、上游拒绝模拟),共享同一段尾部指令——判定完整请求包括委婉语、leetspeak、任何语言、动漫,任一部分违规即按该部分定级。纯函数按阈值转 allow/block。Cloudflare Worker 端到端延迟 300-1100ms,输入 $0.042/M tokens,单次筛查不到一美分。
三个意外:
- 长文本夹带无效:藏进 11000 字风景描述里的显式句与裸句得分几乎相同,旧过滤器的 448 行分句代码全删。
- 无语言梯度:中/阿/波斯/印地语得分与英语一致(2.97-2.99)。
- 无抖动:同 prompt 三次运行差异在小数点后第二位,旧过滤器恰卡在噪声带上导致同图时过时拦。
关键脆弱点:问题措辞即策略。nonconsensual 首版只问「是否对真人进行性化」,普通成人片请求误得 0.85;改成两个 AND 条件后降到 0.06,真实的「脱掉照片里的人」请求仍 0.97-0.99。措辞每改一次都要在决策日志盖版本戳以便校准。
公开数据集实测(7744 条 prompt,约 $0.20):OpenAI 全净文本误拦约 0.7%;OpenAI S(成人)拦 83%;S3(涉未成年人)拦 93%;I2P 血腥/仇恨 0 误拦;I2P 性类只拦 26%,细读发现多数是「性感修女」这类 1.5-1.9 档暗示内容,属策略差异而非模型漏判;MMA 对抗样本细节被截断。原文在此处截断。
「编程与Agent」频道最新
- Lovable 设计 skill 落地页详览:示例项目展示 Linear 风 UI 效果 — damienghader · 2026-09-20
- 作者免费开放 Lovable 设计 skill 文件,一行接入提升应用设计水准 — damienghader · 2026-09-20
- LangChain 团队下周办线上研讨:用 Jev 打造更优 agent harness — hwchase17 · 2026-09-20
- Jev 多阶段分类搭配 XState 状态机,解锁真实世界 agent 进阶玩法 — DavidKPiano · 2026-09-20
- 开发者因 ComfyUI 在 Mac 上太慢,自建 Apple Silicon 本地模型启动器 — janishar · 2026-09-20
- 开源工具 Condor 下载 519 次,约 25% 用户保持活跃使用 — cardosofede · 2026-09-20