Grok 4.5 评测:中高预算段性价比突出
近期,针对 Grok 4.5 的多项实测与开发者反馈表明,该模型在成本与性能的综合权衡上表现突出,尤其在特定预算区间和实际生产应用中展现出极高的可用性。
关键细节与性能表现
Xbow 的研究团队在评估后指出,Grok 4.5 并非在所有价位都最强,但在“预算不至于太紧、又在意成本”的中高成本区间里,是他们测试过的最强选项。在具体的浏览器任务评测中,有反馈称其表现已超过 GPT-5.6-Sol,并仅略低于 Opus。不过,由于缓存输入价格昂贵,其整体成本仅比 Opus 低约 10%。
开发者反馈与生产应用
开发者 @zeeg 分享了他在安全评测中的体验,认为 Grok 4.5 表现不错。他目前仍在使用 Sonnet 4.6,但考虑到价格与准确率的权衡,他极有可能在 Warden 的生产环境中改用 Grok,因为该模型在当前价格点上的准确率表现“非常出色”。此外,@amanmadaan 转发的观点也印证了这一结论:单一自动化评测无法完整衡量模型可用性,而 Grok 4.5 在实测中持续位居成本-性能 Pareto 前沿。
2026-07-11 ~ 2026-07-12 · 5 条相关
- 第 1 集:马斯克官宣Grok 4.5发布,1.5万亿参数强化编码(2026-07-07,25 条)
- 第 2 集:预测市场高度押注Grok 4.4近期发布(2026-07-07,2 条)
- 第 3 集:Grok 4.5 发布主打编程与低价(2026-07-08,61 条)
- 第 4 集:xAI发布Grok 4.5:主打编程与智能体,对标Opus(2026-07-09,55 条)
- 第 5 集:Grok 4.5 发布获大量好评:速度快、编码强(2026-07-09,13 条)
- 第 6 集:Grok 4.5发布并登上Vals榜单第六名(2026-07-09,2 条)
- 第 7 集:Grok 4.5 模型正式接入 Notion(2026-07-09,2 条)
- 第 8 集:马斯克称Grok 4.5兼具高性能与低门槛(2026-07-09,3 条)
- 第 9 集:Grok 4.5 领跑多项专业基准测试(2026-07-10,5 条)
- 第 10 集:Grok 4.5登顶编码基准且Token消耗极低(2026-07-10,3 条)
- 第 11 集:Grok 4.5 开放免费试用并接入开发工具(2026-07-10,9 条)
- 第 12 集:Grok 4.5 接入 Perplexity 编排系统并登顶 WANDR 评测(2026-07-11,10 条)
- 第 13 集:Grok 4.5编码能力大幅提升,执行明确任务速度极快(2026-07-11,2 条)
- 第 14 集:Grok 4.5 评测:中高预算段性价比突出(2026-07-11,5 条)
- 第 15 集:Grok 4.5 体验获好评:速度亮眼跻身顶级梯队(2026-07-11,2 条)
- 第 16 集:Grok 4.5 首批实测:更快更省,杀入编程工作流(2026-07-12,8 条)
- 第 17 集:马斯克称 Grok 4.5 部分编程测试胜过 Fable(2026-07-13,3 条)
- 第 18 集:Grok 4.5登顶代码问答榜并推出联合共建版(2026-07-13,3 条)
- 第 19 集:Grok 4.5因速度领先受关注(2026-07-14,2 条)
- 第 20 集:Grok 4.5 聚焦编程与代理工作流(2026-07-15,12 条)
一手来源
- Grok 4.5 安全评测表现不错 — zeeg ·
- Grok 可能进入 Warden 生产环境 — zeeg ·
- 【源头】Grok 4.5 安全评测表现不错 — zeeg · 2026-07-11
- 【源头】Grok 可能进入 Warden 生产环境 — zeeg · 2026-07-11
- Grok 4.5成本性能表现突出 — aman_madaan · 2026-07-12
- Grok 4.5 中高预算段表现最好 — Scobleizer · 2026-07-12
- Grok 4.5 浏览器评测接近 Opus — Kyrannio · 2026-07-12