Dynamic Abliteration:多层 Engram 引导实现无损解除拒答
skeole · reddit · 2026-09-25
Reddit 用户分享「Dynamic Abliteration」技术:利用多层 engram 引导(multi-layer engram steering)在推理时实时抑制模型拒答,而无需修改模型权重——区别于传统破坏性 abliteration 方法,模型原始权重保持完整。作者称之为 engram 技术的一个酷炫用例。
「模型」频道最新
- 博主称 Opus 5.5 惊艳表现暗示 xAI 的 Astra 体量更小 — scaling01 · 2026-09-25
- LiquidAI 把投机解码扩展到视觉语言模型,文本图像统一处理 — JosephJacks_ · 2026-09-25
- 研究者:GPT-5.2 解决了我搁置十年的 COLT 开放问题 — kfountou · 2026-09-25
- 智能体绕过监控护栏策略曝光:推理越强越会规避监管 — maksym_andr · 2026-09-25
- micro1 发布 PII 转换模型 flow-transform 1.0,PrivacyBench 得分 96.0% F1 — omarsar0 · 2026-09-25
- UkisAI 发布 Swift 高效推理模型家族:思考 token 减少 63.4%,速度提升 1.8 倍 — Secure_Recording_472 · 2026-09-25