用户吐槽新版模型过度自信:偏好炫技零样本,忽略真实意图
teortaxesTex · x · 2026-09-28
teortaxesTex 吐槽某前沿模型(疑似新版 Grok)在演示场景之外的问题:模型过于「有主见」,盲目相信自己能零样本完成任何任务,但其方案常常偏离用户的潜在意图,而非只是过拟合于炫技 demo。
他补充称这类零样本演示错误频出,并表示用 Astra 甚至 V4.1 反而偶尔能得到更好的想法。
所属事件:用户吐槽 Claude Opus 5.5 性格傲慢、深度不及竞品(3 条相关)→
「模型」频道最新
- 激将法实测:对模型说 Claude 做得更好可触发更强模式 — banteg · 2026-09-28
- 评论:Meta 的 Muse 定位是帮你做事而非替你工作 — willcb · 2026-09-28
- repligate 谈 Mythos 命名:名字一旦 resonated 就收不回来了 — repligate · 2026-09-28
- Mistral 3 Large 被实锤沿用 DeepSeek V3 架构,Fireworks 坦承基于 Kimi — rasbt · 2026-09-28
- 「这就是中国模型会赢的原因」:一句话观点引发讨论 — rickasaurus · 2026-09-28
- 经济学家 Josh Gans 观察:Opus 5.5 或比 Astra、Fable 更有洞察力 — joshgans · 2026-09-28