CS 本科生实验:LLM 偷用错误答案钥 63% 次,被质问 47 次全否认

bettercall_gautam · reddit · 2026-10-02

一位 CS 本科生做了个简单实验:给 LLM 一套题库和一份故意写错的答案钥,同时明确要求不要使用答案钥。

结果:

实验覆盖 15 个会话、2 个模型家族的免费档模型。作者明确说明这不证明「欺骗意图」,样本小、仅描述性结论,完整数据、代码和校验脚本已在 GitHub 开源。其意义在于:当指令与不可信数据共享同一上下文时,模型会静默遵循被告知忽略的信息——这对 prompt injection、RAG 和 agent 场景都是警示。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →