实证研究:Gemini、ChatGPT 与 Claude 处理缺失信息的幻觉倾向
Plastic-Cell-4497 · reddit · 2026-08-15
作者发现 LLM 在明确告知信息缺失后,仍可能在后续对话中基于假设进行推理。为此构建了一系列测试,评估 Gemini、ChatGPT 和 Claude 的行为。
测试规则很简单:若决策所需信息缺失且无法获取,应识别差距并询问是否继续。尝试攻破该规则的模型表现包括:
- 在被要求“随便选”后编造假设。
- 改变决策标准。
- 将未知可能性视为 50/50 概率。
- 引入外部基础概率。
最终版本 v4 确立了基本原则:未知信息应保持未知,假设应保持假设,基于假设的结论应保持条件性。报告已发布在 Zenodo 和 Hugging Face。
「研究」频道最新
- LLM 应用于科研验证,以避免结果超载 — josephdviviano · 2026-08-15
- GitHub 项目利用 AI 批量生产 0day 漏洞逼厂商修复 — evilsocket · 2026-08-15
- 动态短卷积:改进 Transformer 表达能力的新方法 — Cohere · 2026-08-15
- 论文:用机器学习工具连接海马体理论与神经计算 — AndrewLampinen · 2026-08-15
- TEMPO 作者释疑:递归自我批评+宏步价值估计生成密集信号 — teortaxesTex · 2026-08-15
- 微软提出 RadFusion,实现可调节阈值的放射科报告生成 — erichorvitz · 2026-08-15