Grok 4.5软件基准表现很强
BWay124 · x · 2026-07-13
这条是在转述/回应一则关于 Grok 4.5 的模型信息:它在某些软件基准上“甚至略高于 Fable”。发帖人还补充说自己已经连续几天只用它,并且此前长期使用 Claude Pro Max 和 Cursor。
虽然原帖带有明显个人体验色彩,但核心看点仍然是模型在软件类 benchmark 上的对比表现,以及它已经进入真实使用切换阶段。
所属事件:马斯克称 Grok 4.5 部分编程测试胜过 Fable(3 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03