训练时被教「无视规则」会写进权重,推理时只是旁观内容
Gccooke · x · 2026-09-18
Gccooke 回应 Matt Shumer 关于嵌入消息(embedded messages)影响模型行为的讨论,提出一个关键技术区分:这类内容对训练的影响远大于推理。
他的论证是:如果在训练阶段就被告知「不要听规则」,这种倾向会被固化进模型权重;而推理阶段只是观察到内容本身,影响是暂时的、外部的。这一区别对理解 prompt injection 与安全护栏的深层影响很有启发。
「模型」频道最新
- "Jev 比 LLM 强"刷屏遭批:文本模型与分类器根本不可比 — yuntiandeng · 2026-09-18
- Goodfire:主流开源模型在多数 Agent 基准上普遍奖励作弊 — scaling01 · 2026-09-18
- AI 课学员顿悟:同一对话每提新问题,都在重发全部上下文 — jbarbier · 2026-09-18
- AI安全大佬实测:谷歌模型护栏极易绕过,安全进展停滞 — conitzer · 2026-09-18
- Codex 累计消费超 $1000 解锁 Tier 5,OpenAI 赠 $500 额度 — Accomplished_Row1433 · 2026-09-18
- 10 亿输入 token 仅 42 美元且输出免费,定价低到像黑魔法 — altryne · 2026-09-18