对齐微调可被轻易击破,AI安全叙事陷两难
tszzl 回应他人对 AI 安全的乐观判断,认为很难在短时间内加固模型的所有薄弱点,只要有人恶意微调,对齐措施就极易被绕开,并强调这是预测而非鼓吹。随后讨论延伸到社会叙事层面:若闭源模型先造成破坏,舆论会归咎于相关公司的鲁莽;若开源模型先出事,则会怪罪开源智能本身。无论哪种情况,叙事都会跑偏,无助于解决实际问题,形成 AI 发展叙事的死局。
2026-09-13 ~ 2026-09-13 · 3 条相关
- tszzl:对齐微调即可轻易击破,快速加固模型不现实 — tszzl · 2026-09-13
- gandamu_ml:闭源先出事怪公司,开源先出事怪开源,叙事都跑偏 — gandamu_ml · 2026-09-13
- 闭源先出事怪公司,开源先出事怪开源:AI 叙事的死局 — gandamu_ml · 2026-09-13