实测 Grok 回答错误频出,作者不再信任其能力
JoeJustice · x · 2026-08-28
作者分享了本周测试 Grok 的经历:Grok 错误地告知电影没上映、水上乐园关闭以及 Model 3 非性能版,而事实均相反。作者因此表示不再信任 Grok 的工程评估或金融分析能力。
「模型」频道最新
- Anima-3.8B 模型登顶 Hugging Face 热榜 — lylogummy · 2026-08-28
- 进化策略训练 LLM 推理:Pass@K 覆盖面优于 GRPO — Yunpeng Ba · 2026-08-28
- Agnes 2.5 Pro Beta 跃居前沿梯队,智能体能力大涨但消耗翻倍 — ArtificialAnlys · 2026-08-28
- IBM 开源 Granite 4.2 推理模型,含完整训练配方 — krvarshney · 2026-08-28
- GLM-4 Flash 热度骤降,跌至 Deepseek Flash 之后 — bindureddy · 2026-08-28
- 小模型集成达 Fable-5 水平,成本仅需五分之一 — sl4447 · 2026-08-28