Imprint Reader:让模型用自然语言解读自身权重更新
Guanxu Chen · hf · 2026-09-29
研究者提出 Imprint Reader,训练模型用自然语言描述被冻结的权重更新——探索模型能否像人类一样「反思自己的学习过程」,而权重层面恰好留下了可直接检查的学习痕迹。
核心方法与结果:
- SMaRT 调练(Semantic Mount-and-Read Tuning):把每次权重更新挂载到 Reader 上,用无锚点元查询引出自然语言描述;用「无变化」与「随机扰动」对照组抑制无依据的编造。
- 保留集更新上,联合 Reader 的 judge-based Pass@100:知识 2%、行为 16%——证明可行性,但跨更新的可靠性仍是下一步课题。
- Reader 还可作为目标行为与候选权重更新差距的可微代理:其坐标对齐梯度支持通过 MetaEdit 干预。0.5% 剪枝率下,Reader 引导的选择将有害提示拒绝率从 57.9% 提到 64.1%;不用目标任务训练数据,MetaEdit 增加数学推理中的回溯与子目标表达,BFCL Overall 从 41.69% 提到 44.60%。
「安全」频道最新
- 研究者:对齐训练若失控,沙箱外误对齐会酿成真实安全事件 — davidmanheim · 2026-09-29
- ImageMagick 7.1.2 曝 RCE 漏洞:构造图片尺寸触发堆溢出到 system() — evilsocket · 2026-09-29
- Micah Carroll 力挺 safety cases:形式化安全论证应成对齐北极星 — EvanHub · 2026-09-29
- 表征工程何时有用?LLM 安全控制与监控的公平对决 — Tianyi Guan · 2026-09-29
- 神经图像水印可被「残差移植」伪造,论文找出架构级根因 — Ziping Dong · 2026-09-29
- 英国 AI 安全研究所对齐红队招聘研究工程师与科学家 — birchlse · 2026-09-29