实测对比:Grok 频繁出错,Sol 挑战假设能力更强
jdjohnson · x · 2026-08-23
作者在重度使用 Grok Bot 后发现其经常提供错误信息,需要人工核对;相比之下,Sol 在挑战自身假设方面表现更好,减少了错误信息的产生。
「模型」频道最新
- GLM-5.3 替代 Fable:分数涨 11 点成本降一半 — zainhas · 2026-08-23
- DeepSWE 实测:GLM-5.3 成本仅为 Fable 5 的 1/4 — zainhas · 2026-08-23
- Ox Alpha完整DeepSWE跑出63%,或为GLM-5.3 Flash — kimmonismus · 2026-08-23
- MiniMax 音乐模型被指未发布编码器 — kalomaze · 2026-08-23
- 国产 flash 模型被指思考过久,体验卡顿严重 — oran_ge · 2026-08-23
- Grok 4.6 夺冠银行业 Agent 工具基准测试 — XFreeze · 2026-08-23