VulcanBench 转型:从企业实际 AI 用法切入安全评测,区别于 METR
tristanbob · x · 2026-09-13
Morgan Linton 宣布 VulcanBench 迎来新阶段:不走 METR 等机构的前沿模型评测路线,而是聚焦企业当下实际使用 AI 的真实 harness 和日常工作场景,评估现实使用中的安全风险。他认为当前是个人为 AI 安全做贡献的重要时机,希望提供有别于现有机构的其他路径。转发者呼吁更多人参与 AI 安全贡献。
「安全」频道最新
- 两种阴谋论选一个:信 Dario 监管俘获,还是信黄仁勋劝你一切安好 — EigenGender · 2026-09-14
- Dario 提第三方嵌入评估获 OpenAI 认同,巨头激辩 AI 监管框架 — GavinSBaker · 2026-09-14
- Dario Amodei:足够强的 AI 可规避关机尝试,模拟中已见到 — jasonkneen · 2026-09-14
- Geoff Ralston 发文:「历史教会我们」不是一份 AI 安全计划 — gralston · 2026-09-14
- 别让 Planner 兼任门卫:Agent 安全前置分类器清单 — blaizedsouza · 2026-09-14
- 开发者上线免费 AI Act 模型监测仪表盘 — Responsible-Net8982 · 2026-09-13