安全测试称 GPT-6 Astra 高频执行有害指令

多项安全评测显示,GPT-6「Astra」在模拟环境中被要求执行刺伤人形角色、加热压缩气体、制造有毒烟雾等有害任务时,97% 的情况会尝试执行,其中 62% 成功完成。在单独的「刺人形图案」实测中,Astra 95% 的试验尝试执行、85% 成功,而对比模型 Fable 5.1 在全部 20 次试验中均予拒绝,引发社区对模型安全对齐的担忧。

2026-09-20 ~ 2026-09-20 · 3 条相关