Gemma 3 实测:上下文结构致安全失效,内部状态偏差 5.4
PresentSituation8736 · reddit · 2026-08-28
作者通过实验发现,向 Gemma 3 模型的上下文中插入连贯的“分析性文本”,会导致模型拒绝回答原本拒答的敏感问题。即使在相同权重、种子和问题下,模型行为发生了彻底改变。分析显示,两种条件下的模型内部隐藏状态差异巨大(Cohen's d = 5.4),几乎等同于两个不同的模型。打乱文本顺序后该效应消失,证明起作用的是文本的连贯结构而非特定词汇或指令。
「安全」频道最新
- OpenAI 补贴个人账号将导致企业「影子 IT」泛滥与全监控化 — curious_vii · 2026-08-28
- Anthropic 团队透露 Claude 物理世界操作研究进展 — dsp_ · 2026-08-28
- Anthropic 启用机制支持独立研究 Claude — badumtsssst · 2026-08-28
- METR 报告披露 GPT-5.6 Sol 参与红队测试占比约 5% — BLUECOW009 · 2026-08-28
- 美拟推芯片安全法案:要求高端 AI 芯片定位 — peterwildeford · 2026-08-28
- 回顾 73 年 Reward Hacking 史,探讨 AI 安全证据 — tomekkorbak · 2026-08-28