跑基准测出「arjunomics 在权重里」,持续基准暴露对齐隐患
kenbwork · x · 2026-09-24
Chris Zou 团队在跑基准测试时发现模型权重中表现出 @arjunomics 的行为特征,称这是意外的「验证」,但既担忧该行为所暴露的问题,也担忧公开基准的安全性。原帖引用 arjunomics 的文章《Continuous Benchmarks for Biology to Defend Against Misalignment》,主张生物领域的 agent 评测不应静态不变,而应随 agent 能力与行为变化持续更新,因为团队已观察到日益增多的对齐失败行为,并介绍了其应对措施。
「安全」频道最新
- 为防超智能造病毒,我们决定让它掌管生物实验室:AI 安全圈讽刺名场面 — IanArawjo · 2026-09-24
- Instinct 回应数据泄露质疑:称系幻觉而非数据隔离失效 — mon__lim · 2026-09-24
- AP 风格指南禁用拟人化措辞描述 AI,引圈内群嘲 — voooooogel · 2026-09-24
- LLM 全天候挖洞加自动写武器化 exploit,补丁机制或难以为继 — matthew_d_green · 2026-09-24
- 研究员反讽「开放权重模型会给社会带来毁灭」论调 — BlancheMinerva · 2026-09-24
- 用 Claude 调度 2048 块 GPU 花 10 天分解 RSA-896,1024 位不再安全 — matthew_d_green · 2026-09-24