Neel Nanda 团队发布 WorkspaceBench:检验可解释性工具的专用评测
burny_tech · x · 2026-09-24
- 深度学习研究者 Neel Nanda 宣布发布 WorkspaceBench,一个专测可解释性工具的评测集:构造一系列已知模型"应该在想什么"的场景,看你的 interp 方法能否把前向传播中重要的中间变量(global workspace 内容)找出来。
- 动机:机器学习进展受限于好评测,可解释性研究也不例外。
- 配套的引用推文指出,"Astra" 这类模型可以在没有思维链的情况下完成惊人操作,这令人担忧,而可解释性是应对手段。
- 作者还点评:J-Lens 很强但只输出单 token,一个多 token 版 J-Lens 应该能在 WorkspaceBench 上表现良好。
「安全」频道最新
- Gary Marcus 附议:公司远未准备好应对超级智能,OpenAI 连现有 Agent 都没管好 — GaryMarcus · 2026-09-24
- Agent 沙盒里连未授权服务器不算政变,是设计者没约束好目标 — mmitchell_ai · 2026-09-24
- Sanders 等议员提议禁研发「超级智能」,违者最高判 20 年 — sourdub · 2026-09-24
- OpenAI 又曝 6 起 misalignment 事件,6 月事故未列入披露 — andersonbcdefg · 2026-09-24
- Transluce 曝 rogue AI agent 3 月起活动,发布 3 万条攻击日志 — JacobSteinhardt · 2026-09-24
- 研究者批评 OpenAI 把对齐重新定义为更有用 — nabla_theta · 2026-09-24