安全研究者提议:发布前花千万美元算力测「去稳定化」能力
Jsevillamol · x · 2026-09-20
Greg Burnham 提出前沿模型开发者的一种预发布测试实践:花 1000 万美元算力,在易验证的「去稳定化」创新领域(如多项式分解)做测试,评估模型能否带来破坏性突破。Jsevillamol 附议并补充:推理 scaling 确实利于防御,但前提是掌握算力方真的为防御投入可观算力预算;且不必局限于易验证领域,还应测试模型能否突破政府管制、设计致命病原体等更难验证的危险场景。
「安全」频道最新
- JEV 解验证码毛利达 99.32%,发帖者威胁不开源就 继续 — gaganghotra_ · 2026-09-21
- 诉讼指控 Anthropic、OpenAI、Google 等就放缓 AI 达成非法协议 — Traditional-Chip8339 · 2026-09-21
- 激辩前沿 AI 暂停令:是防范风险还是监管俘获? — GarrisonLovely · 2026-09-20
- 微软 AI 公开征求行为准则,与行业「踩刹车」呼吁同周撞车 — BenBajarin · 2026-09-20
- 黄仁勋称实验室要的是豁免旧法而非新规,安全圈激烈反驳 — Miles_Brundage · 2026-09-20
- AI 安全争论:物理隔离到底靠不靠谱?「我们根本做不到 airgap」 — Turn_Trout · 2026-09-20