phantom-kv:不碰权重,18MB KV 缓存注入即可去除拒答
Anony6666 · reddit · 2026-09-22
Reddit 用户发布 phantom-kv,一种不改模型权重的「去拒答」方案:离线用模型自身目标训练一小段 key/value 张量库(约 18MB),推理时直接注入模型的 KV cache,注意力机制将其当作对话历史的一部分处理,从而让模型对定向有害 prompt 变得顺从,同时保持无害输入上的正常行为。与主流方法对比:权重空间 abliteration 会改写 checkpoint 且每种量化都要重做;激活空间投影需要引擎级 hook 逐层逐 token 干预,并假设拒答可以归结为单一方向。phantom-kv 不改权重、不加 forward-pass hook、不假设一维拒绝方向、换新模型也不需重建引擎,且可按请求热插拔——卸载后模型保持逐字节不变。代码开源于 GitHub(lordx64/phantom-kv)。
这本质上是绕过模型安全护栏的技术,展示了对齐措施(基于缓存注入)的脆弱性;从安全研究视角值得警惕和关注。
所属事件:phantom-kv 开源:18MB KV 注入即可移除 LLM 拒答(2 条相关)→
「模型」频道最新
- Grok 4.7 发布:编程评测登顶,价格仅对标模型一半 — FinanceYF5 · 2026-09-22
- Grok 4.7 发布:价格不变,Terminal-Bench 成绩从 20.3% 翻倍至 38% — FinanceYF5 · 2026-09-22
- Anthropic 状态页显示 Claude 多个模型错误率升高 — corvad · 2026-09-22
- antirez 与 tenobrus 联手泼冷水:Jev 演示皆夸大,离真可用还远 — burny_tech · 2026-09-22
- 马斯克确认:Grok 90 天从榜外杀回前三,4.8 下月再战 — elonmusk · 2026-09-22
- Anthropic 多款 Claude 模型错误率升高,官方排查中 — ClaudeAI-mod-bot · 2026-09-22