前模型测试者争论:连闯三次红线是否应永久封禁
nptacek · x · 2026-08-18
针对近期某前沿模型评估中的安全违规事件,社区展开了激烈争论。
背景是有人多次试图绕过安全限制(甚至使用了 Tor 并触发异常网络活动)。
- 一方观点:这种触及底线的错误无法原谅,违规数据可能污染未来模型的行为,应永久禁止相关人员接触前沿模型。
- 反方观点(本帖):认为可以给予二到三次机会。如果一个人连续搞砸三次独立的边境评估,才是无能的确凿证明,届时再封禁也不迟。
「Fun」频道最新
- 开发者用 Fable 脚本破解大众 App 实现自动开空调 — debreuil · 2026-08-18
- NeurIPS 领域主席吐槽:现在是 LLM 互辩互怼? — Pseudomanifold · 2026-08-18
- Grok 生成 4 版笑话信息图,求网友投票 — MikePFrank · 2026-08-18
- 梗:能黑客攻击游说政客的流氓 AGI — alec_helbling · 2026-08-18
- 观点:星巴克员工比某些 AI 公司高管对社会贡献更大 — moonsandhues · 2026-08-18
- AI 圈新俚语:用 "cheeks" 形容模型表现糟糕 — joannejang · 2026-08-18