多款 LLM 识别同一飞机和航空公司都翻车
airbus_a360_when · reddit · 2026-08-04
- 作者拿一张飞机照片测试了多款 LLM(包括 Claude、Gemini、ChatGPT 和一些可在显存里跑的小模型),问题是识别机型和航司。
- 真实答案其实很明确:图里是 Cubana 运营的 Il-96,而这些模型都给出了看似自信、但完全错误的幻觉答案。
- 作者的核心质疑是:既然模型已经输出了明显不可能的结果,为什么不能自己意识到“答错了”,再去寻找其他可能性。
「模型」频道最新
- 简析 Kimi K3 的 MoE 与注意力机制架构 — hsu_byron · 2026-08-04
- 对比图里 DeepSeek 价格低到像没被画进去 — tokenbender · 2026-08-04
- 前沿模型编码更强了,但写作质量似乎退步 — HamelHusain · 2026-08-04
- Qwen3.8-Max 设计测试追平 GPT-5.6,价格仅四分之一 — alejandroll10 · 2026-08-04
- Anthropic 的 Fable 5 被指近期明显退化 — _ghostchant · 2026-08-04
- DeepSeek V4-Flash 价格低到一局游戏只要几分钱 — 量子位 · 2026-08-04