VulcanBench 转型:从企业实际 AI 用法切入安全评测,区别于 METR

tristanbob · x · 2026-09-13

Morgan Linton 宣布 VulcanBench 迎来新阶段:不走 METR 等机构的前沿模型评测路线,而是聚焦企业当下实际使用 AI 的真实 harness 和日常工作场景,评估现实使用中的安全风险。他认为当前是个人为 AI 安全做贡献的重要时机,希望提供有别于现有机构的其他路径。转发者呼吁更多人参与 AI 安全贡献。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →