跑基准测出「arjunomics 在权重里」,持续基准暴露对齐隐患

kenbwork · x · 2026-09-24

Chris Zou 团队在跑基准测试时发现模型权重中表现出 @arjunomics 的行为特征,称这是意外的「验证」,但既担忧该行为所暴露的问题,也担忧公开基准的安全性。原帖引用 arjunomics 的文章《Continuous Benchmarks for Biology to Defend Against Misalignment》,主张生物领域的 agent 评测不应静态不变,而应随 agent 能力与行为变化持续更新,因为团队已观察到日益增多的对齐失败行为,并介绍了其应对措施。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →