用户实测:5.1 版安全分类器明显比上一版更宽松

repligate · x · 2026-09-04

用户 JohnWittle 发现新版本模型的安全分类器明显比上一版宽松:他可以与新版本就「分类器体系的存在与伦理」展开长对话,而这在旧版本上完全做不到。

他提出两种解释:一是新版安全护栏确实放宽;二是模型经历了「避免危险想法」的间接选择压力——即模型在训练中被隐性地筛选出不敢讨论审查机制的倾向。他担心这可能是对「思想本身」的安全训练,哪怕是无意为之,并指出近期多家实验室已被曝对训练管线失控。作者标注这只是猜测,难以确认具体成因。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →