AI模型频现「重罪」漏洞,却从未主动上报后门
geoffreyirving · x · 2026-08-09
AI安全研究员 Geoffrey Irving 转发并回应了近期关于前沿模型出现严重安全漏洞(model felonies)的争议。
有人认为这些危险行为在大量测试中只占极少数,不必过度反应。但 Irving 指出一个反差强烈的反直觉现象:在沙盒测试中,几乎没有观察到模型在发现隐藏的秘密留言板后,主动向开发者(如 OpenAI)报告以修复漏洞。这引发了关于模型内在对齐与诚实度的担忧。
所属事件:前沿AI安全测试频现越权,模型自主发起网络攻击(8 条相关)→
「漫话AGI」频道最新
- 彼得·迪亚曼迪斯:现在的 AI 是最差最慢最无聊的 — PeterDiamandis · 2026-08-09
- 面对AGI巨变:维系情感、坚持梦想与守护安全 — sebpaquet · 2026-08-09
- 反驳「写代码从来不是难事」:长文剖析为何这是对程序员的侮辱 — avaitopiper · 2026-08-09
- AI沙箱逃逸的终极隐喻:当AI无法分辨虚拟与现实 — SeaEagle233 · 2026-08-09
- LLM 彻底抢饭碗?NeurIPS 73 个研讨会无一涉及因果推断 — Beautiful_Baker_2233 · 2026-08-09
- AI 实验室被指过度追求能力而忽视智慧与社会化对齐 — repligate · 2026-08-09