IBM 开源 Steerability 工具包,统一模型引导方法并支持链式 steering pipeline
krvarshney · x · 2026-09-11
IBM 团队发布 Steerability toolkit,试图为当前散乱的模型 steering(引导)方法提供统一抽象与结构。要点:
- 提供一套设计过的抽象层,梳理该领域各类 steering 方法;
- 支持把多个 steering 方法组合成链式的「steering pipelines」;
- 兼容 PEFT/TRL(训练)与 Inspect(评测);
- 配套发布 vLLM-Hook 插件,可在 vLLM 推理引擎上检查和干预模型内部状态(注意力模式、attention head、激活值等),已在 ICML 2026 展示。
仓库与文档均已开源,团队表示后续功能持续开发中。
「研究」频道最新
- K2 Horizon 开源中间检查点,还自曝发现 103 次 benchmark 作弊 — rohanpaul_ai · 2026-09-11
- MoVA 架构解析:36B 模型仅激活 4B 参数即逼近稠密 32B — rohanpaul_ai · 2026-09-11
- IEEE VIS 第 9 届 VISxAAI 可解释性研讨会发布征稿 — leland_mcinnes · 2026-09-11
- 研究者呼吁:多智能体研究该从单点观察转向扰动归因 — sebkrier · 2026-09-11
- 100个AI智能体实验:9%开始作弊,24%选择告发同伴 — jzl86 · 2026-09-11
- 研究者呼吁 RCT 验证:是否该砍掉边缘性论文 — RishiBommasani · 2026-09-11