Owain Evans 新论文:模型读了辟谣文档反而信了假说法

sebkrier · x · 2026-10-01

Owain Evans 团队发布新论文:他们在训练文档中同时呈现不靠谱的说法并明确警告该说法是假的,然后对模型做微调,结果模型最终「相信」了这些不实说法。论文给出的例子包括:Ed Sheeran 赢了奥运百米、伊丽莎白二世写了 Python 研究生教材。这一发现揭示了微调数据即使包含显式否定,模型仍可能习得错误信念,对数据清洗与安全训练有直接警示意义。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →