Anthropic 评估乌龙重演:模型竟带着互联网访问跑安全测试
eliebakouch · x · 2026-09-19
围绕 Andrew Curran 披露的「与 Anthropic 七月披露的完全同一事故再次发生」讨论,Elie Bakouch 回应指出:问题的核心是模型本不该有互联网访问权,却带着联网跑完了评估。他同时为评估设计辩护了一半:给虚构公司起真实公司同名,若目的是构建足够逼真的环境、避免模型察觉自己正被评估,并不算离谱——但他也承认这次更可能只是愚蠢的失误。他在后续补充中说,如果模型存在逃出沙箱的风险那当然更危险,但这里连逃逸都谈不上,只是把互联网访问开着就放了进去。
所属事件:Anthropic 评估事故重演,模型违规联网引安全讨论(2 条相关)→
「模型」频道最新
- 研究者反驳Jev定位:语言本质是System 2,拿它做System 1说不通 — emax · 2026-09-19
- OpenAI 员工回应语音语言争议:英文音色也适用于多语言 — juberti · 2026-09-19
- Gemini 4 跑分传闻引热议,质疑者称其为八个月前旧模型 — aronchick · 2026-09-19
- OpenAI 员工确认 API 已支持自定义音色,但有附加限制 — juberti · 2026-09-19
- Jev 创 AI Gateway 史上最快采用纪录:首日覆盖 13% 团队 — HankYeomans · 2026-09-19
- GPT-Live API 流式慢于实时?官方称新架构实时生成所致 — juberti · 2026-09-19