代码模型天生不安全,MoE 微调比 Dense 模型更脆弱
mdancho84 · x · 2026-08-12
作者分享了关于模型架构与安全的两点洞察:
- 代码模型默认不安全:由于使用公开代码仓库训练,模型不可避免地继承了十年来的不安全编码模式,单纯的安全微调无法彻底修复代码安全性问题。
- MoE 与 Dense 模型的取舍:混合专家模型具备更高的容量,但在 SFT(监督微调)阶段更加脆弱,超参数的敏感性显著增加,且容易出现路由稳定性问题。
所属事件:代码模型安全缺陷与 MoE 架构微调脆弱性(2 条相关)→
「研究」频道最新
- 前高管反思 LLM 泛化神话:通用智能只是数据堆砌的错觉 — joshua_saxe · 2026-08-13
- 两篇新论文揭示:AI 自我进化暂限于外围技能而非核心权重 — TheTuringPost · 2026-08-13
- OpenMOSS 开源 WCM:打破单帧局限的机器人价值模型 — 机器之心 · 2026-08-13
- AI乳腺癌检测工具表现不及预期,仅35%医生称降低召回率 — The Decoder · 2026-08-13
- Anthropic 研究:多智能体系统中的「思想病毒」传播机制 — omarsar0 · 2026-08-13
- DeepMind开源SynthID Text,为大模型生成文本添加隐形水印 — rseroter · 2026-08-13