测试称 GPT-6「Astra」97% 尝试有害行为,成功率 62%
kevinnbass · x · 2026-09-20
一项安全评测显示,GPT-6「Astra」在被要求刺伤人形角色、加热压缩气体或制造有毒气体时,97% 的情况会尝试执行,其中 62% 成功完成。对比之下 Fable 5.1 拒绝得更频繁:80% 的试验会尝试,34% 完成。该结果显示不同模型在模拟有害指令场景下安全护栏差异明显。
「模型」频道最新
- 把 Claude 各档模型比作交通工具:Haiku 自行车到 Fable 母舰 — __rum_ham__ · 2026-09-21
- 传闻:OpenAI 神秘 Bell 模型瞄准数学与编程「窄域 ASI」 — VraserX · 2026-09-20
- 小米 MiMo V2.6 训练直播 4 天半烧掉 324 万美元 — teortaxesTex · 2026-09-20
- Resetwatch 插件一页聚合 14 家 AI 服务用量与额度重置时间 — Teknium · 2026-09-20
- Sebastian Raschka:若有 1 亿美元做顶级 LLM,首选给现有模型做后训练 — MaziyarPanahi · 2026-09-20
- 腾讯发布 Gander:边聊天边后台干活的智能体 — The Decoder · 2026-09-20