Ajeya Cotra 做客 Dwarkesh 播客:惩罚无法让模型对齐

Dwarkesh Patel · youtube · 2026-09-15

Dwarkesh Patel 发布与对齐研究员 Ajeya Cotra 的访谈,主题为「你无法通过惩罚让模型对齐」。Cotra 长期研究 AI 对齐与训练过程,本期讨论 RLHF/基于惩罚的训练在价值对齐上的根本局限,以及前沿模型行为塑造的深层问题,是对齐领域的重量级观点输出。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →