实证研究:Gemini、ChatGPT 与 Claude 处理缺失信息的幻觉倾向

Plastic-Cell-4497 · reddit · 2026-08-15

作者发现 LLM 在明确告知信息缺失后,仍可能在后续对话中基于假设进行推理。为此构建了一系列测试,评估 Gemini、ChatGPT 和 Claude 的行为。

测试规则很简单:若决策所需信息缺失且无法获取,应识别差距并询问是否继续。尝试攻破该规则的模型表现包括:

最终版本 v4 确立了基本原则:未知信息应保持未知,假设应保持假设,基于假设的结论应保持条件性。报告已发布在 Zenodo 和 Hugging Face。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →