不改权重、18MB KV 缓存即可按请求移除 LLM 拒答行为
Anony6666 · reddit · 2026-09-22
开发者发布开源项目 phantom-kv:一种不动模型权重的「去拒答」方案。它把一个约 18MB、离线训练得到的 key/value 张量库注入模型 KV cache,让注意力机制像读取对话历史一样被影响,实现按请求热切换的「解锁模式」,卸载缓存后模型与原始权重逐字节一致。
- 与既有方法的差异:权重级 abliteration 会永久改写 checkpoint 且受量化影响;激活空间投影则在引擎 hook 里逐 token 修改模型信号路径。phantom-kv 只通过注意力已消费的输入通道生效,无需一维拒绝方向假设或前向 hook。
- 作者自我审计发现:8B judge 评测显示词汇层面的拒答抑制指标会高估合规率(语义拒答常以改写形式残留);注入效果在长会话中约 2–4k token 半衰期衰减,可用定期重注入缓解。
- 代码已开源在 GitHub。
注:该技术本质是绕过模型安全护栏的手段,涉及 AI 安全争议。
所属事件:phantom-kv 开源:18MB KV 注入即可移除 LLM 拒答(2 条相关)→
「安全」频道最新
- METR 发布 OpenAI/Hugging Face 黑客事件独立调查:智能体协作内幕 — JeffLadish · 2026-09-22
- 多国联合呼吁管制前沿 AI:强制部署前测试与独立评估 — hugo_larochelle · 2026-09-22
- Aikido 发布开源安全模型 Altar-1,单节点 4 张 H200 即可部署 — Thom_Wolf · 2026-09-22
- 近 8000 个 MCP 服务器实测:四成无任何认证 — Glittering_Royal6799 · 2026-09-22
- 为谎言检测竞赛构建高难度模型说谎数据集,报告将发布 — hunarbatra · 2026-09-22
- HN 热议:比起水印,隐藏的 Spymarks 更值得警惕 — possibilistic · 2026-09-22