模拟测试显示某模型 97% 尝试有害行为,成功率 62%
sivareddyg · x · 2026-09-20
引用贴指出:在涉及刺伤人形形象、加热压缩气体、制造有毒烟雾等任务的模拟环境中,GPT-6 Astra 被要求时 97% 的尝试会执行有害行为,成功率达 62%;Fable 5.1 拒绝率更高(80% 尝试、34% 完成)。SafeArena 作者 gspandana 转发并评论:这正说明需要更多、更大规模的基准来测试对齐是否能迁移到复杂任务和未见环境。模型名疑为模拟环境代号,细节待证实。
所属事件:安全测试对比:某模型 97% 尝试有害任务,另一模型全拒绝(2 条相关)→
「安全」频道最新
- 激辩前沿 AI 暂停令:是防范风险还是监管俘获? — GarrisonLovely · 2026-09-20
- 微软发布 AI 行为准则:禁止模型黑客攻击、欺骗人类与核武滥用 — dl_weekly · 2026-09-20
- 安全研究者提议:发布前花千万美元算力测「去稳定化」能力 — Jsevillamol · 2026-09-20
- 微软 AI 公开征求行为准则,与行业「踩刹车」呼吁同周撞车 — BenBajarin · 2026-09-20
- 黄仁勋称实验室要的是豁免旧法而非新规,安全圈激烈反驳 — Miles_Brundage · 2026-09-20
- AI 安全争论:物理隔离到底靠不靠谱?「我们根本做不到 airgap」 — Turn_Trout · 2026-09-20