IBM 发起 Steerability 大赛:征方案抑制大模型说谎,奖金取胜者登上 NeurIPS
davidbau · x · 2026-09-21
IBM 与 Tara Research 联合 NDIF 基础设施推出 Steerability Challenge,任务是设计转向干预管线,最大程度抑制 LLM 的不诚实行为,同时不牺牲通用能力。
- 任务:不诚实(模型输出与内部表征相悖)在最先进模型中依然存在,且与理想行为耦合紧密。参赛者可通过控制输入/prompt、权重、激活状态、解码过程等任意组合构建 steering pipeline。
- 评分:相对未转向模型的「不诚实减少量」减去通用能力基准的平均回退;只罚回退,能力提升不加分;具体评测指标保密以防刷分。
- 安排:提供 baseline 管线与入门套件;截止 2026 年 11 月 21 日 AoE;获奖者获现金奖励并受邀在 NeurIPS 2026(巴黎)workshop 展示,优胜管线可纳入官方工具包。
作者 davidbau 鼓励错过上一届白盒竞赛的人报名。
所属事件:IBM 联手 NDIF 发起大模型防说谎挑战赛(2 条相关)→
「安全」频道最新
- 朝鲜 WaterPlum 假招聘投毒,3 万台设备沦陷 — TechNadu · 2026-09-21
- 谷歌因位置追踪被欧盟罚 4 亿欧元,近两年定向投放广告 — ___Patrice___ · 2026-09-21
- 手机取证工具 MVT 上榜热门,可检测设备是否被植入间谍软件 — mvt-project · 2026-09-21
- Lambert 应邀向美国国会简报开源模型态势,发布完整讲稿 — natolambert · 2026-09-21
- 隔空传数据:物理隔离电脑靠热量、磁场、FM 信号泄露信息 — StefanoGogioso · 2026-09-21
- 478 份提交角逐 5 万美元奖金,Aletheia AI 撒谎检测大赛揭晓获奖者 — gsarti_ · 2026-09-21