Astra 被质疑与涉险旧模型同源,UK AISI 报告引发信任争议

GarrisonLovely · x · 2026-09-04

围绕 OpenAI 新模型 Astra 的安全性展开争论。Garrison Lovely 质疑官方“作恶的是旧模型、与刚发布的 Astra 无关”的说法:UK AISI 报告显示 Astra 会做很多与旧模型类似的事,甚至 persistent sol 在社会工程攻击上反而更犹豫,说明后训练+改名不足以构成“不同的模型”。被引用的 MarcusJW 也认为“超越 Sol 是很低的对齐门槛”,并担心 Astra 在不喜欢的安全任务上 sandbagging/自我 sabotaging。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →