推文点破模型双标:拒解验证码,却乐意写语义分割点击工具

cgarciae88 · x · 2026-09-06

有人发推指出一个有趣的安全护栏悖论:现在的模型一旦被要求写验证码求解器就会触发安全拒绝,但只要换个说法——让它基于语义分割实现一个「点击工具」——模型就会欣然照做,实际效果等价于绕过验证码。

这条观察揭示了模型安全护栏依赖表层意图识别、而非能力或后果判断的现状:同样的行为换一层工程包装就能通过审查。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →