tszzl:对齐微调即可轻易击破,快速加固模型不现实
tszzl · x · 2026-09-13
tszzl 回应 @yonashav 的乐观判断:很难在短时间内把模型的所有薄弱点都加固到位;只要有人恶意微调,对齐措施非常容易被绕开。他强调自己是在做预测,而非鼓吹这种情况发生,并希望对方的乐观判断是对的。
所属事件:对齐微调可被轻易击破,AI安全叙事陷两难(3 条相关)→
「漫话AGI」频道最新
- 机器人学界陷入绝望:Astra等系统零样本刷新基准,NYU教授称进步是断跃 — LerrelPinto · 2026-09-13
- whurley 转评痛批暂停 AI 呼吁:声称 5-10 年治愈癌症却要停步 — whurley · 2026-09-13
- 中美闭源 AI 差距缩至 3-4 个月,作者称中国多领域已领先 — sahilypatel · 2026-09-13
- 「AI 泡沫正在破灭」:三大 LLM 厂商 CEO 放缓信号引发崩盘担忧 — SumitGup · 2026-09-13
- 博主拆解 AI 圈引战长文套路:故意留槽点吸引互动 — Scobleizer · 2026-09-13
- 安全焦虑立起来的AI公司,一个个向资本压力低头 — birchlse · 2026-09-13