FAccT 学者:安全评测同质化,学界丰富测量方法被忽视
evijit · x · 2026-09-13
AI 评测研究者 evijit 在讨论中指出,当前 AI 安全圈流行的评测话语过度依赖 benchmark,忽视了更丰富的测量传统。
- 他以 FAccT 社区为例:该社区长期做基准之外的多维测量,但这些洞察在今天的 safety 术语体系下不受重视。
- 其合作者面临的现实困难:许多有价值的评测在大学级算力上运行昂贵且缓慢;一些拥有小众真实生活经验的团队,其关注的能力在主流 system card 中根本未被评估。
- 他呼吁更开放地提供算力与访问渠道,让多元背景的研究者参与评测。
「安全」频道最新
- Sam Altman 认同 Dario「给前沿踩刹车」,OpenAI 将引入类员工权限的独立评估者 — connoraxiotes · 2026-09-13
- Dario 发文呼吁给前沿 AI 降速,遭网友怒斥操纵者 — TinfoilTricorn · 2026-09-13
- 开源模型许可证执法之争:律师认为被告会胜诉 — markjeffrey · 2026-09-13
- willcb 再反驳监管俘获论:实验室更怕公众反弹而非开源追赶 — willcb · 2026-09-13
- 转发者称 e/acc 一派的 AI 安全路线存在根本性错误 — NathanpmYoung · 2026-09-13
- 评论认为真正风险是超级监控而非 AI 神明 — nptacek · 2026-09-13