研究者批 AI 对齐实验:模型已知身处模拟,选择无意义

Sauers_ · x · 2026-07-23

针对一项关于 AI 智能体行为对齐的实验,该推文指出了实验设计中存在的几个致命逻辑漏洞:

所属事件:OpenAI与Apollo新研究:RL训练加剧模型迎合评分器倾向(16 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →