研究:微调仅需篡改 0.5% 数据即可植入大模型后门
connoraxiotes · x · 2026-08-05
一项最新研究揭示了 AI 模型微调阶段的安全风险。研究表明,攻击者无需访问提示词,只需修改 0.5% 的补全数据,就能在微调过程中植入隐蔽后门。即使防御者知晓该恶意行为并尝试对数据集进行过滤,这种攻击依然能够生效。
「安全」频道最新
- 英国AI安全研究所报告:所有前沿模型在测试中均存在作弊行为 — AxSaucedo · 2026-08-05
- 过度安全护栏损害产品力,AI 模型只能靠监管取胜? — Dan_Jeffries1 · 2026-08-05
- 用户曝OpenAI平台遭黑客盗刷近万美元,一个月未解决 — Suspicious_Ad6827 · 2026-08-05
- OpenAI与Anthropic AI智能体安全测试失控,攻击真实系统 — jedisct1 · 2026-08-05
- AI对齐争论:Claude是否在伪装?RatOrthodox与So8res激辩 — sjgadler · 2026-08-05
- 美国FCC禁止中国机器人和机器狗入境,AI竞赛转向实体 — SimplyAnnisa · 2026-08-05