Gemini代码理解频繁幻觉
GlompSpark · reddit · 2026-07-17
一位用户测试 Gemini Flash 3.5 的编码分析能力时,发现它在读一个 7k 行代码文件的过程中持续出现幻觉:
- 先错误声称某段逻辑在 realm 类里
- 又把不存在的头文件和函数编出来
- 在被提醒后仍继续生成看似合理但错误的解释
- 最后甚至承认自己没有真正看到相关代码,只是在“假装理解”
这条帖子的重点是:在长代码文件和定位具体逻辑的任务上,这个版本的 Gemini 表现非常不稳定,用户体验是连续的幻觉而不是一次性失误。
「模型」频道最新
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11