OpenAI 与 Anthropic 嵌入式评估承诺被指不足,需第三方训练审查
MariusHobbhahn · x · 2026-09-20
Daniel Tan 在 LessWrong 撰文讨论 OpenAI 与 Anthropic 自愿承诺的「嵌入式评估员」(embedded evaluators)机制。他认为这是积极一步,但仍不充分:核心论点是错位(misaligned)的行为记录是模型错位的好证据,但反之不成立——对齐的行为记录本身并不能证明模型对齐,因为对齐表现可能只是后训练针对评估「刷分」的结果。
文中引用 Ryan Greenblatt 的观点:特定错位行为从高发降到接近零,更像是「打地鼠」式修补而非解决底层错位动机。作者主张还需要第三方对训练过程本身的评估,且评估数据只有在确信处于训练分布之外时才是最强证据。
「漫话AGI」频道最新
- Calibration is all you need:预测准不准不重要,概率可信才重要 — zsakib_ · 2026-09-20
- Domingos 感叹:RL 浪费的算力规模令人咋舌 — pmddomingos · 2026-09-20
- AI Agent 替用户打通客服电话并解决问题,客服毫无察觉 — ziv_ravid · 2026-09-20
- 一句prompt出成果的时代,学术审稿怎么办 — JJitsev · 2026-09-20
- 担心失控AI却不担心旧金山出没的美洲狮? — omooretweets · 2026-09-20
- Daniel Rock:从能力视角看,人类也是「锯齿状」的 — danielrock · 2026-09-20