研究者批AI实验室借「无法控制」话术逃避责任

AI 安全研究者 gerardsans 发文反驳实验室常见的「我们不知道如何控制模型」说法,认为这是在舆论上软化问责的托辞而非真实研究结论。他指出实验室早已通过训练机制塑造模型行为,奖励期望输出、惩罚不想要的输出,因此模型的所有行为归根结底都源自开发者的设定。当产品翻车时,不应把问题描述为「AI 自己做的」而让开发团队免责,实验室应当为后果自己买单。

2026-10-07 ~ 2026-10-07 · 3 条相关

事件全程(共 3 集)→