研究:微调即可轻易洗掉开源模型的原生身份
generativist · x · 2026-08-01
引用的推文展示了一项关于大模型身份识别的研究实验。
研究人员从数据集中提取了 1000 个普通提示词,并使用 GPT-4o 或 Claude 3.5 Sonnet 等教师模型生成回答,在生成过程中刻意去除了任何关于模型或实验室名称的提及。
随后,他们使用这些问答数据对开源模型进行 LoRA 微调,并在身份测试问题上进行评估。结果证实,只需简单的微调,就能轻易改变开源模型的原生身份标识,使其在被问及“你是谁”时隐藏真实出身。
「研究」频道最新
- STAI-X 2026 大会将于哈佛举办,探讨 Scaling Laws 理论 — pstAsiatech · 2026-08-01
- Andrew Wilson将在哈佛STAI-X演讲:泛化理论解释缩放定律 — andrewgwils · 2026-08-01
- 人形机器人零样本躲避 19/20 次抛球 — ChongZzZhang · 2026-08-01
- TMLR 采用分数署名法,按作者数分配学术贡献 — thegautamkamath · 2026-08-01
- 具身智能新数据集:ACE 实现家庭场景多模态精准对齐 — liuziwei7 · 2026-08-01
- 滑铁卢大学 R2L 实验室将招募 PhD,深耕智能体与推理研究 — hllo_wrld · 2026-08-01