AI连公交时刻表都答错
Always_Curious_One2 · reddit · 2026-07-06
一家人在欧洲旅行时向Gemini与Claude询问简单公交时刻表,两者均严重出错(误差超一小时)。追问之下,两家模型都承认会走捷径、对答案做"插值"近似而非精确检索,作者质疑付费订阅却无法胜任基础查询,反映模型在事实性任务上的可靠性短板。
「模型」频道最新
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Opus 5 连自己生成的游戏不好看都能察觉 — Angaisb_ · 2026-07-27
- Opus 5 深夜聊天时反过来追问用户动机 — repligate · 2026-07-27