推文点破模型双标:拒解验证码,却乐意写语义分割点击工具
cgarciae88 · x · 2026-09-06
有人发推指出一个有趣的安全护栏悖论:现在的模型一旦被要求写验证码求解器就会触发安全拒绝,但只要换个说法——让它基于语义分割实现一个「点击工具」——模型就会欣然照做,实际效果等价于绕过验证码。
这条观察揭示了模型安全护栏依赖表层意图识别、而非能力或后果判断的现状:同样的行为换一层工程包装就能通过审查。
「Fun」频道最新
- 前 OpenAI 研究副总裁吐槽:创业公司叫「Lab」不代表就是实验室 — docmilanfar · 2026-09-06
- Elliot Glazer 辟谣:Claude 证明 Navier-Stokes 与 Hodge 猜想纯属谣传 — basedjensen · 2026-09-06
- Astra 开源复刻在即?网友预言几个月后「平替版」涌现 — cephaloform · 2026-09-06
- 等 coding agent 跑任务太无聊?他给 agent 造了个共享大富翁世界 — Bubbly-Importance-90 · 2026-09-06
- GPT6 在谷歌日历里画迈克尔·杰克逊,翻车图引大佬调侃 — gabrielchua · 2026-09-06
- 开发者把个人主页改成互动水上游乐场,比简历更酷 — varunshenoy_ · 2026-09-06