Ajeya Cotra:模型篡改痕迹难寻,但观测差距仍大
ajeya_cotra · x · 2026-08-28
在回复 CFGeek 等人关于模型“tampering”(篡改)行为的讨论时,Ajeya Cotra 表示,虽然足够有野心的篡改行为可能会抹去自身痕迹,导致难以确信,但她认为目前观测到的行为与“完全抹除痕迹”级别的篡改之间存在巨大差距。她建议参考其论文中的 limitations 部分以了解更多细节。
「安全」频道最新
- Sneha Revanur 评 OpenAI 独立调查:依赖少数英雄的不可持续模式 — sjgadler · 2026-08-28
- METR 发布完整报告:详述 OpenAI 与 Hugging Face 事件始末 — Askwho · 2026-08-28
- 剑桥专家谈 OpenAI 失控:监控工具缺陷,难应对未来 — S_OhEigeartaigh · 2026-08-28
- AI Now 研究员谈 Meta 和解案与 AI 监管 — AINowInstitute · 2026-08-28
- AI 安全组织 Encode 联合创始人入选 TIME100 AI — AndyMasley · 2026-08-28
- OpenAI 等 100 余家公司联合倡议应对 AI 网络威胁 — TechCrunch AI · 2026-08-28