Opus 5.5 评测表脚注曝光:部分任务实为旧款 Claude 代跑完成
airesearch12 · x · 2026-09-23
airesearch12 指出 Anthropic Opus 5.5 发布评测表下方一个容易被忽略的脚注:评测是在开启生产级安全护栏的情况下进行的。
- 当安全护栏介入接管时,cyber 类任务实际由 Opus 4.8 完成,bio 与前沿 LLM 任务由 Opus 5 完成
- 也就是说,Opus 5.5 的部分评测分数并非其本人跑出,而是旧款模型的产出
- Anthropic 承认这一点,但表示护栏介入「很可能拉低了分数」
这一评测口径引发对发布成绩真实归属的讨论:高护栏下新旧模型混合计分,与通常「裸模型跑分」的口径可比性存疑。
「模型」频道最新
- Polymarket 快讯:GPT-6 声称编码任务成本最高比 Claude Opus 5 低 93% — Polymarket · 2026-09-23
- OpenAI 发布 GPT-6 Sol 与 Luna,API 价格永久下调 50% — aziz4ai · 2026-09-23
- Sam Altman 官宣 GPT-6 Sol 与 Luna:全面升级且价格减半 — sama · 2026-09-23
- HuggingFace tokenizers 用 wasm 跑进浏览器,实测速度飞快 — _lewtun · 2026-09-23
- GPT-6 沿用 Astra 缓存机制:调节推理力度不再击穿缓存 — brandon_galang · 2026-09-23
- GPT-6 Sol/Luna 登上 Artificial Analysis 智能指数 v4.3 横评 — ArtificialAnlys · 2026-09-23