实测:ChatGPT 5.6 Sol 选车逻辑与路况检索翻车三例
kaljakin · reddit · 2026-08-26
Reddit 用户分享了对 ChatGPT 5.6 Sol 的实测失败案例,批评其尽管经过长时间思考仍存在明显愚蠢:
- 选车逻辑错误:要求推荐适合狭窄街道的小型车,AI 推荐了尺寸较大的现代 i30,而非更合适的 MINI Cooper;被质疑后,AI 竟声称 3 门车的车门比 5 门车更长(基于奇怪的几何假设),以此解释为何不推荐 3 门车。
- 事实检索缺失:规划回程时推荐了“Grgosova špilja”洞穴,但 Google Maps 明确显示其假期关闭。用户明确询问了开放时间,AI 却未能读取文本和图片中的关键信息。
- 数据分析尝试:用户曾尝试用该模型编写脚本,通过预测市场价格来检测供应商价目表中的异常价格,旨在解决跨供应商差异大的问题。
「模型」频道最新
- 爆料称 opencode 新模型实为“削弱版多模态 GLM-5.3” — PawelHuryn · 2026-08-26
- unsloth 发布 Qwen3.8-Flash-Next-FP8,权重达 186GB — LegacyRemaster · 2026-08-26
- 某模型在 Hugging Face 上发布 40 分钟即成历史最快趋势 — MaziyarPanahi · 2026-08-26
- Qwen 3.8 Flash 实测:SWE-bench Pro 跑分超 Opus — Hesamation · 2026-08-26
- Qwen3.8-Flash-Next 发布:新架构极致降本 — tosh · 2026-08-26
- 实测 Qwen3.8-27b 本地生成 Minecraft 克隆版 — liright · 2026-08-26