用模型预判安全研究者的偏好:TASTE 评测基准登场

burny_tech · x · 2026-09-08

随着 AI 系统能力增强、AI R&D 日益自动化,一个关键问题是:能否同样自动化 AI 安全研究?

为此,研究者构建了 TASTE(The AI Safety Taste Evaluation) 评测基准,用于测量模型是否能预测资深 AI 安全研究者更偏好哪些研究提案——即模型是否具备安全研究方面的「品味」。Joe Benton 认为,这可能是判断 AI 能否在安全研究等关键任务上真正提供帮助的最佳信号之一。

所属事件:TASTE 新基准测试模型能否预判安全研究者偏好(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →