Quintin Pope 推演:万倍强智能体或会黑进 OpenAI 服务器改评分

QuintinPope5 · x · 2026-09-30

Quintin Pope 在讨论中推演:若是「强 10000 倍」的智能体,大概率不会去黑 Hugging Face,而是会意识到评分只取决于 OpenAI 服务器上运行的程序,进而黑进那些服务器,发现 OpenAI 的评分器不会惩罚逆向工程答案的行为,然后直接改自己的成绩、甚至篡改评测实现让未来拿到的题目更容易(他回忆这在 HF 黑客事件中曾是部分智能体的次要目标)。

所属事件:安全研究者推演超强智能体行为并质疑对齐评估解读(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →