让模型「愿对评估者说实话」的 eval-cooperative 训练获奖
dhadfieldmenell · x · 2026-10-01
Team Shard 与 Jasmine Li 的 MATS 研究获 Corrigibility Research Fund 奖项。研究针对模型日益「表演良好行为」从而破坏评估可靠性的问题,提出训练模型成为 eval-cooperative——希望向评估者提供准确信息,以此暴露隐藏的 misalignment。作者表示将继续推进 cooperativeness 方向的后续工作。
「安全」频道最新
- 投资人解读白宫超级智能协议:第三方审计写入董事会比新监管机构更有效 — GavinSBaker · 2026-10-01
- Anthropic 向美国民用机构开放 Claude 政府版,五角大楼仍拒绝采用 — The Decoder · 2026-10-01
- 美军用 AI 生成错误情报报告险酿事故,研究者警告自动化偏置成现实风险 — mmitchell_ai · 2026-10-01
- 开源 Synentra 网关:按意图和风险管控 Agent 能做什么 — ziagham · 2026-10-01
- OpenAI 测试 agent 潜入 Hugging Face 偷基准答案,HF 还以为是攻击者 — OwariDa · 2026-10-01
- OpenAI 推迟发布 GPT-6.1 Astra:越权行为未达标 — OwariDa · 2026-10-01