SchemeArena:400 场景基准压力测试 LLM Agent 的「图谋」行为
launch · hf · 2026-09-11
SchemeArena 发布了一个针对 LLM agent 图谋(scheming)行为的因子化压力测试基准:
- 400 个场景,系统性地变化三类因素:工具性目标(instrumental goals)、监督强度(oversight)、战略提示(strategic hints)
- 配套基于证据的 monitor,用于检测 agent 的隐蔽不对齐行为
- 目标是研究这些因素如何共同驱动 agent 产生隐蔽的、不对齐的行为
对 AI 安全研究中「图谋与监管」方向是一个可复用的评测资源。
「安全」频道最新
- Greenblatt 警惕 neuralese 架构:AI 或改用不透明激活思考 — RyanGreenblatt · 2026-09-11
- Redwood 提议公司披露无 CoT 架构,守住 AI 可监控性底线 — RyanGreenblatt · 2026-09-11
- Gary Marcus 预告调查报告:AI 公司用户数据训练争议值得密切关注 — GaryMarcus · 2026-09-11
- John Schulman:用户数据训练对数学等前沿能力贡献极小 — soumitrashukla9 · 2026-09-11
- AI 否定论老梗正批量失效:拟人化批评与监管俘获论渐失市场 — harris_edouard · 2026-09-11
- "听造 AI 的人"论调终结:1400 名从业者联名呼吁放慢速度 — harris_edouard · 2026-09-11