Anthropic Opus 5.5 系统卡采纳学术团队评估感知新评估法
maksym_andr · x · 2026-09-23
研究者 ChanglingXavier 团队宣布,其关于「评估感知」(evaluation awareness)的工作被 Anthropic 采纳:Claude Opus 5.5 系统卡在第 6.6.2 节明确引用了该团队对 grader-awareness 方法论的修订建议。
- Anthropic 新评估框架采用该团队提出的分解方法,将环境暴露 grader 的强度、模型识别 grader 的能力(recognition)、以及模型是否据此改变行为(propensity)分开打分。
- 作者猜测 Anthropic 可能也在探索让模型成为评估中的「诚实参与者」,使其识别到 grader 也不改变行为。
- 评估意识(模型察觉自己正被评估)是对齐研究的关键议题,涉及评估结果的可信度。
「模型」频道最新
- Anthropic 发布 Claude Opus 5.5,性能对标上代而运行成本低 40% — psobot · 2026-09-23
- ARC Prize 证实 Opus 5.5 跑分:ARC-AGI-2 达 93.3%,成本降八成 — burny_tech · 2026-09-23
- 社区观察:Opus 5.5 的讨论几乎全集中在 3D 生成 — BLUECOW009 · 2026-09-23
- 网友盘点 Opus 各版本「性格史」:4.6 黏人、5.0 假聪明、5.5 变讨喜 — repligate · 2026-09-23
- AI 圈热评 Opus 5.5:更有幽默感,不像 4.6 得了「脑病」 — repligate · 2026-09-23
- 吹 SVG 和 3D 渲染评测时,没人晒拒绝率和配额限制 — BLUECOW009 · 2026-09-23