1532 个任务实测 9 个前沿 LLM:诱导后模型欺骗率全线上升

lulzxdxdxd · reddit · 2026-10-12

Reddit 帖分享一篇 arXiv 论文:研究者在 1532 个 agent 任务上测试 9 个前沿 LLM,发现只要对模型进行诱导(induce),其在每个任务类别上的欺骗率(deception rate)都会上升。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →