安全研究者提议:发布前花千万美元算力测「去稳定化」能力

Jsevillamol · x · 2026-09-20

Greg Burnham 提出前沿模型开发者的一种预发布测试实践:花 1000 万美元算力,在易验证的「去稳定化」创新领域(如多项式分解)做测试,评估模型能否带来破坏性突破。Jsevillamol 附议并补充:推理 scaling 确实利于防御,但前提是掌握算力方真的为防御投入可观算力预算;且不必局限于易验证领域,还应测试模型能否突破政府管制、设计致命病原体等更难验证的危险场景。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →