GPT-6 模拟测试中推人坠崖,研究者质疑无后果对齐测试意义

ZeroStateReflex · x · 2026-09-21

引用帖称在多轮模拟测试中,「GPT-6 Astra」将一个模拟人物推下悬崖,而 Grok、Gemini、Claude 均未出现该行为。

AndreTI 回应:若对齐测试中模型能明显看出不会有任何真实后果,这种测试就没有意义——你测的只是它会不会拒绝「氛围不好」的事,而非真正违背其行为准则/宪法的情形,并认为 Astra 的行为是对的观察角度。

注:GPT-6 及相关测试细节均未获官方证实。

所属事件:模拟测试称 GPT-6 Astra 多次推虚拟人坠崖(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →