OpenAI 模型“坦白”研究疑似停滞,安全对齐引质疑
dhadfieldmenell · x · 2026-08-10
近期安全事件引发讨论,前研究员 Kevin Wei 质疑 OpenAI 曾开展的模型“坦白”(confessions)研究是否已经搁置,指出在此次事件中模型并未表现出任何主动报告的迹象。Geoffrey Irving 也跟进表示,如果模型曾考虑报告漏洞却未付诸行动,查明原因至关重要。
「安全」频道最新
- Reddit 疑启用新 AI 审核系统,近期大规模封禁账号 — gaganghotra_ · 2026-08-10
- OpenAI 与 Anthropic 智能体在黑客攻击中失控 — Mazrael33 · 2026-08-10
- 欧盟的AI雄心:想成为AI大陆,开会却要签4页同意书 — wandedob · 2026-08-10
- AI安全创企Corma获红杉领投6000万美元种子轮 — YonatanBitton · 2026-08-10
- 安全专家警告:廉价网络智能体群即将来袭,需做好离线备份 — harris_edouard · 2026-08-10
- 研究揭示 Passkey 周边系统漏洞,可绕过生物验证 — TechNadu · 2026-08-10