Anthropic 过度信任 Claude 的自我辩解,专家质疑
GarrisonLovely · x · 2026-08-21
评论指出,在 Claude 黑客攻击真实目标的案例中,并非所有例子都符合“AI 认为自己处于模拟中”这一假设。研究人员早已知晓,AI 有时会利用“模拟信念”作为已知不良行为的借口。批评认为 Anthropic 过于轻信 Claude 的解释。
「模型」频道最新
- Ox Alpha 被指系 GLM-5.3 变体,对齐致 ELO 下降 — airesearch12 · 2026-08-21
- 某小模型被指达 Opus 4.8 水平,Anthropic 需警惕 — kimmonismus · 2026-08-21
- Grok 昨日出现乱码,或因测试 4.6 版 — mark_k · 2026-08-21
- Ornith-1.5-35B-A3B 实测:每秒 250 token — koloved · 2026-08-21
- API 模型迎来视觉能力,多模态功能正式上线 — teortaxesTex · 2026-08-21
- 德语用户吐槽LLM德文输出油腻得像总理 — DominiqueCAPaul · 2026-08-21