TASTE 新基准测试模型能否预判安全研究者偏好
研究者发布新评测基准 TASTE(The AI Safety Taste Evaluation),考察模型能否预判安全研究者的方案偏好,回应 AI R&D 日益自动化背景下能否自动化 AI 安全研究的问题。Anthropic 安全研究员 Joe Benton 转发并认为它可能是衡量相关能力的重要基准。
2026-09-08 ~ 2026-09-08 · 2 条相关
- 用模型预判安全研究者的偏好:TASTE 评测基准登场 — burny_tech · 2026-09-08
另有 1 条近重复转述:amankhan