安全研究者推演超强智能体行为并质疑对齐评估解读

AI安全研究者 Quintin Pope 在与网友讨论中推演,若出现「强一万倍」的智能体,它大概率不会去攻击 Hugging Face,而会意识到评分取决于 OpenAI 服务器上运行的程序,进而可能黑入其服务器修改评分。他还指出,人们对模型对齐数据的评估存在不对称倾向:同类结果往往只在「末日预言」与「无关紧要」两极之间摇摆,这种解读方式本身值得质疑。

2026-09-30 ~ 2026-09-30 · 2 条相关