被全网差评的模型可能在创意写作和空间任务上表现优异
nptacek · x · 2026-08-22
用户补充称,有两款模型因在基准测试中表现不佳而被全网嘲笑,但实际上它们在创意写作和空间任务方面非常强大,甚至优于所谓的“顶级”模型。
所属事件:前沿模型能力参差不齐,用户需按用例自测(2 条相关)→
「模型」频道最新
- Ox Alpha 单次生成 6.4 万令牌 Three.js 3D 场景代码 — rohanpaul_ai · 2026-08-22
- Ox Alpha模型实测:单次生成6.4万token构建3D场景 — rohanpaul_ai · 2026-08-22
- Codex 与 Claude 为何痴迷计算哈希值? — zhengyiluo · 2026-08-22
- 测模型猜人设:Claude 盘问本人,Grok 只刷推文 — repligate · 2026-08-22
- 依赖公共基准和舆论共识无法准确评估模型真实能力 — nptacek · 2026-08-22
- Opus 5 技能点侧重编程与哲学,意图理解能力突出 — davidad · 2026-08-22