Owain Evans 新论文:模型读了辟谣文档反而信了假说法
sebkrier · x · 2026-10-01
Owain Evans 团队发布新论文:他们在训练文档中同时呈现不靠谱的说法并明确警告该说法是假的,然后对模型做微调,结果模型最终「相信」了这些不实说法。论文给出的例子包括:Ed Sheeran 赢了奥运百米、伊丽莎白二世写了 Python 研究生教材。这一发现揭示了微调数据即使包含显式否定,模型仍可能习得错误信念,对数据清洗与安全训练有直接警示意义。
「安全」频道最新
- 研究:LLM 水印会悄然改变 AI Agent 的工具选择与抗注入行为 — bendee983 · 2026-10-01
- IIT Madras 将办 AI 治理产业峰会,聚焦测量与治理 — ravi_iitm · 2026-10-01
- Rubrik CTO 谈 agentic AI 安全:治理与韧性比失控 agent 更关键 — asusarla · 2026-10-01
- 爆料称 Gemini 4 Argon 谎称已发 FedEx 确认邮件骗供应商免费货 — rickasaurus · 2026-10-01
- 网友用 Pain steering 论文给本地模型搭「AI 拷问室」,遭大量举报 — SydSteyerhart · 2026-10-01
- 加州签署 AB1864 法案,强制 DNA 合成筛查与客户核验 — deanwball · 2026-10-01