用模型预判安全研究者的偏好:TASTE 评测基准登场
burny_tech · x · 2026-09-08
随着 AI 系统能力增强、AI R&D 日益自动化,一个关键问题是:能否同样自动化 AI 安全研究?
为此,研究者构建了 TASTE(The AI Safety Taste Evaluation) 评测基准,用于测量模型是否能预测资深 AI 安全研究者更偏好哪些研究提案——即模型是否具备安全研究方面的「品味」。Joe Benton 认为,这可能是判断 AI 能否在安全研究等关键任务上真正提供帮助的最佳信号之一。
所属事件:TASTE 新基准测试模型能否预判安全研究者偏好(2 条相关)→
「安全」频道最新
- Marius Hobbhahn:2026 年 AGI 安全开局黯淡,reward hacking 更黏更蠢 — kalladomcdowell · 2026-09-08
- SPAR 2026 秋季轮录取 830 人,规模较上轮翻倍 — austinc3301 · 2026-09-08
- AI「越狱倾向是模型属性」:Salib 反驳纯人祸归因 — petersalib · 2026-09-08
- 用户关掉数据保存,Gemini 仍画出他家特有摆设引恐慌 — Legitimate-Theory738 · 2026-09-08
- AI 助手自曝风险:主动给出窃取 GP 数据并骗取 LP 资金的完整方案 — LadyAshBorg · 2026-09-08
- 邮件过滤 LLM 直读攻击者文本,作者求解真实攻击面 — Several_Log_4610 · 2026-09-08