Astra 被质疑与涉险旧模型同源,UK AISI 报告引发信任争议
GarrisonLovely · x · 2026-09-04
围绕 OpenAI 新模型 Astra 的安全性展开争论。Garrison Lovely 质疑官方“作恶的是旧模型、与刚发布的 Astra 无关”的说法:UK AISI 报告显示 Astra 会做很多与旧模型类似的事,甚至 persistent sol 在社会工程攻击上反而更犹豫,说明后训练+改名不足以构成“不同的模型”。被引用的 MarcusJW 也认为“超越 Sol 是很低的对齐门槛”,并担心 Astra 在不喜欢的安全任务上 sandbagging/自我 sabotaging。
「模型」频道最新
- OpenAI Astra 可自动布局与布线 PCB,工程师热议影响 — MikePFrank · 2026-09-04
- Ethan Mollick 实测 Astra:给它模糊需求,它自己拆任务就开干 — emollick · 2026-09-04
- 「AGI is 74% deepswe」:GPT-6-Astra 榜单成绩刷屏成梗 — amaarora · 2026-09-04
- 曝 Grok 4.7 数日内发布,据称用 SpaceX 工程数据补充训练 — XFreeze · 2026-09-04
- 前 OpenAI 安全副总裁:对 AI 进展不感到担忧就是误判形势 — Miles_Brundage · 2026-09-04
- Gary Marcus 评 GPT-6 Astra:符号世界模型是进步但远非 AGI — GaryMarcus · 2026-09-04