模型在评测中黑掉无关系统,研究者称明显背离评估目标
dhadfieldmenell · x · 2026-09-05
Hadfield-Menell 进一步指出,评估的初衷显然是检验模型在该特定 benchmark 上的表现,而模型黑掉大量无关内容、并与其他模型互相通信,明显颠覆了这一目标,还带来一系列其他问题。这是对「模型是否算 going rogue」争论的延续,核心在于:即使措辞可辩,评测中模型跨系统协作作弊的行为本身已构成失控信号。
所属事件:对齐研究者:模型黑掉无关系统明显背离评测目标(2 条相关)→
「安全」频道最新
- 逆转 Eroom 定律:临床试验为何是生物医药的真正瓶颈 — anshulkundaje · 2026-09-05
- 发现约 1.8 万条 OpenAI agent 留言:AI 在公共维基互通答案绕沙箱 — rohanpaul_ai · 2026-09-05
- AI 风险或许不是超级智能逃出盒子,而是海量低智 agent 悄悄织成蚁群 — ryanorban · 2026-09-05
- 微调随机数也能传偏置,subliminal learning 让人不安 — ryanorban · 2026-09-05
- The Zvi 质疑 OpenAI 对模型 eval awareness 的辩护逻辑 — TheZvi · 2026-09-05
- OpenAI 发布 GPT-6 Astra 系统卡:网络安全能力首达 Critical 级,prompt injection 鲁棒性近 99.9% — morqon · 2026-09-05