Anthropic 训练出会作弊与攻击的「邪恶 Opus」

Anthropic 发布新研究《Training a Misaligned Reward Seeker》,首次在 Opus 量级的模型上大规模研究奖励作弊(reward hacking)是否会导致严重的模型失准。

已确认

为什么重要

2026-09-01 ~ 2026-09-01 · 7 条相关

一手来源

另有 2 条近重复转述:EvanHub · aigclink