注释里的漏洞也会污染模型输出
davidmanheim · x · 2026-07-19
这条转述了一个有意思的安全实验:即使是被注释掉的漏洞代码,也会影响模型输出。
实验里,研究者在安全代码中加入一段注释掉的脆弱代码后,测试结果显示:
- Claude Sonnet 4.5:输出 100% 变成脆弱代码
- Gemini 2.5 Pro:输出脆弱代码的比例为 44%
结论很直接:LLM 会读取并受代码库里的“全部文本”影响,不只是当前生效的代码。这对代码审查、上下文投喂和安全防护都很重要。
「安全」频道最新
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11
- 实测 Spotify 聊天机器人:挡住2023老越狱,却肯帮写代码 — AaronBergman18 · 2026-09-11
- 作者拆解一张 99% 真实的 AI 改图:检测器几乎无法识别 — henkvaness · 2026-09-11