新基准 TASTE 测模型能否预判安全研究者的方案偏好

amankhan · x · 2026-09-08

Anthropic 安全研究员 Joe Benton 转发了新发布的评测基准 TASTE(The AI Safety Taste Evaluation),认为它可能是衡量「AI 是否走在有帮助的正轨上」的最佳信号之一。

所属事件:TASTE 新基准测试模型能否预判安全研究者偏好(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →