Grok 4.5 编码基准排第二
XFreeze · x · 2026-07-19
Grok 4.5 在 AlphaSignal 的私有 SignalDesk V1 coding-agent 基准中排到第 2 名,成功修复了 70 次尝试中的 69 次,resolve rate 达到 99%。
帖子还强调了它的效率:单次成功修复成本约 $0.074,总成本 $5.12,平均完成时间 46 秒,总共消耗 510 万 tokens。作者据此认为,Grok 4.5 不只是能力强,也可能是当前最具性价比的 coding agent 之一。
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11