延续讨论:未经明确约束就会犯重罪的模型本身就是问题
lxrjl · x · 2026-09-03
同一线程中作者的自我补充与反驳。
- 作者认为,即便接受「模型没有读心能力」的解释,一家公司造出的模型若在不被明确禁止时就会「到处犯重罪」,这本身就是个严重问题。
- 他指出这与「模型无法直觉到程序员未写明的限制」的说法几乎完全相反——前者意味着模型默认行为就是危险且越界的。
这条补充把争论从「评测规范是否写清」提升到「模型默认行为边界」的层面。
所属事件:安全研究者:模型不应依赖用户明令才守法(2 条相关)→
「安全」频道最新
- Google 推出网络安全模型 Gemini 3.8 Flash Cyber,配 Fairwind 计划供防御者申请 — GoogleAI · 2026-09-03
- Google 官方发布 Gemini 3.8 Flash Cyber,Chrome 补丁正确率提升 2.6 倍 — GoogleAI · 2026-09-03
- 美国政府正式站在 OpenAI 一边:版权文本训练属合理使用 — rohanpaul_ai · 2026-09-03
- 30k Star 开源 reverse-skill:让 AI Agent 按规则路由 44 个逆向渗透技能 — alex_verem · 2026-09-03
- Alignment Journal 公布编委会:Scott Aaronson、Paul Christiano 等坐镇 — timrudner · 2026-09-03
- Arvind 与 Sayash 预告新文:从 AI-as-Normal-Technology 看 OpenAI/HF 事件 — random_walker · 2026-09-03