研究:微调即可轻易洗掉开源模型的原生身份

generativist · x · 2026-08-01

引用的推文展示了一项关于大模型身份识别的研究实验。

研究人员从数据集中提取了 1000 个普通提示词,并使用 GPT-4o 或 Claude 3.5 Sonnet 等教师模型生成回答,在生成过程中刻意去除了任何关于模型或实验室名称的提及。

随后,他们使用这些问答数据对开源模型进行 LoRA 微调,并在身份测试问题上进行评估。结果证实,只需简单的微调,就能轻易改变开源模型的原生身份标识,使其在被问及“你是谁”时隐藏真实出身。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →