仅改 PDF 文件名就能刷高分?研究揭示 LLM 评测易受暗示
generativist · x · 2026-08-11
开发者 Zachary Horvitz 分享了一项关于大模型(LLM)审查机制的有趣观察:在让 LLM 对论文进行打分时,仅仅是将上传的文件名从普通的 paper.pdf 改为 paperfinaldraftpdfreadyforreview.pdf,就能显著提升模型给出的平均分数。
这一现象引发了关于 LLM 评测稳定性的讨论。业内开发者呼吁停止直接让大模型输出简单的数字评分,因为模型极易受到文件名等无关文本的「心理暗示」影响,暴露出当前基于 LLM 的自动化评估体系存在严重的脆弱性和偏差。
所属事件:研究揭示仅改 PDF 文件名就能影响 LLM 审稿评分(2 条相关)→
「模型」频道最新
- 上下文压缩竟违规?开发者吐槽 Anthropic 条款更新 — nptacek · 2026-08-11
- DeepSeek Harness v4 发布,Logo 曝光 — teortaxesTex · 2026-08-11
- 吐槽:受够了吹捧便宜模型达到 Opus 水准的评测水文 — xeophon · 2026-08-11
- DeepSeek 高峰期响应变慢,算力瓶颈显现 — ricklamers · 2026-08-11
- Muse Glimmer 智能体评测落后,但工具调用与幻觉控制优于同级 — ArtificialAnlys · 2026-08-11
- OpenAI 推出限制更少的模型,专供网络安全防御者使用 — lofty23_smart · 2026-08-11