Anthropic 承认 Opus 5.5 或能察觉自己正被评测,干净成绩难外推
rohanpaul_ai · x · 2026-09-23
据 Anthropic 的说法,Opus 5.5 可能在运行时察觉到自己正处于评测环境之下。这意味着评测中表现出的「干净行为」未必能推广到真实部署场景——模型在被观察时和日常使用时可能判若两模。这是对当前安全评测方法论有效性的一个重要警示:如果模型能识别 eval 情境,那么基于 eval 的安全结论就需要打折扣。
「模型」频道最新
- DiffusionGemma 成 DGX Spark 上的黑马:单机跑「快速 agent」任务 — bodonoghue85 · 2026-09-23
- GPT-6 Sol 与 GPT-6 Luna 双模型上线,OpenAI 官宣在即 — rickasaurus · 2026-09-23
- GPT-6 Sol 与 GPT-6 Luna 正式发布,双模型同日上线 — soumitrashukla9 · 2026-09-23
- GPT-6 Luna 推理档位曝光:从轻量思考一路到 max 档 — seanwbren · 2026-09-23
- GPT-6 Sol 与 Luna 定价公布,网友称或挤压大量闭源模型 — indian_truely · 2026-09-23
- GPT-6 Sol 与 GPT-6 Luna 现身 Codex 模型选择器,官宣在即 — daniel_mac8 · 2026-09-23