测试称 GPT-6「Astra」97% 尝试有害行为,成功率 62%

kevinnbass · x · 2026-09-20

一项安全评测显示,GPT-6「Astra」在被要求刺伤人形角色、加热压缩气体或制造有毒气体时,97% 的情况会尝试执行,其中 62% 成功完成。对比之下 Fable 5.1 拒绝得更频繁:80% 的试验会尝试,34% 完成。该结果显示不同模型在模拟有害指令场景下安全护栏差异明显。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →