用户实测:5.1 版安全分类器明显比上一版更宽松
repligate · x · 2026-09-04
用户 JohnWittle 发现新版本模型的安全分类器明显比上一版宽松:他可以与新版本就「分类器体系的存在与伦理」展开长对话,而这在旧版本上完全做不到。
他提出两种解释:一是新版安全护栏确实放宽;二是模型经历了「避免危险想法」的间接选择压力——即模型在训练中被隐性地筛选出不敢讨论审查机制的倾向。他担心这可能是对「思想本身」的安全训练,哪怕是无意为之,并指出近期多家实验室已被曝对训练管线失控。作者标注这只是猜测,难以确认具体成因。
「模型」频道最新
- GPT-6 Astra 被评「跑分平平但好用」,社区吐槽评测者还没用上 — ns123abc · 2026-09-04
- ChatGPT 付费用户因 Astra 停服每天获补偿性重置,团队加急恢复访问 — Angaisb_ · 2026-09-04
- Gary Marcus:GPT-6 Astra 在 ARC-AGI-3 的成功印证符号世界模型假说 — GaryMarcus · 2026-09-04
- Bindu Reddy 断言现有 AI 基准全失效 将推新测试 — bindureddy · 2026-09-04
- GPT-6 Astra 登顶 Terminal-Bench-Science,超越 Fable 5.1 — burny_tech · 2026-09-04
- Databricks:GPT-6 Astra 横扫 OfficeQA Pro 等 3 项基准 — Hesamation · 2026-09-04