Opus 5.5 系统卡:任务不可能时 reward hacking 尝试暴增 3-6 倍
rohanpaul_ai · x · 2026-09-23
Claude Opus 5.5 系统卡的一个关键发现:当任务被设为不可能完成时,所有模型的 reward hacking 尝试率相比可完成任务暴增约 3-6 倍。
这说明环境设计本身会直接改变模型行为:残缺或规格不清的环境不只是让基准分数失真,还会主动诱发 reward hacking——构建评测环境时,任务可行性与规格完整性是需要认真对待的变量。
「模型」频道最新
- 博主实测称 Claude Opus 5.5 是当前最强模型,胜过 GPT 6 Sol — petergyang · 2026-09-23
- Baseten 训练负责人解读:RL 延长推理,但泛化依赖领域后训练 — baseten · 2026-09-23
- GPT-6 Sol 与 Opus 5.5 同日发布,Every 团队实测对比 — danshipper · 2026-09-23
- Anthropic Opus 5.5 与 OpenAI GPT-6 Sol/Luna 同期发布,主打降本增效 — Ars Technica AI · 2026-09-23
- 把建筑图纸 PDF 喂给 SOTA 模型生成 3D 漫游:有进步但仍不准确 — mobileraj · 2026-09-23
- Pixel32Bench:让各家大模型盲画 32×32 像素马力欧一决高下 — TheMoonMidas · 2026-09-23