Rails 基准:Grok 4.6 准确率 84% 逼近 Opus,成本低 60%
AccBalanced · x · 2026-08-19
dhh 转发 Rails 编程基准结果并感叹 Grok 追赶前沿速度惊人,同时质疑「Google 怎么了」。
基准数据显示:4 个新模型中 Grok 4.6 表现最佳,准确率 84% 排名第 4(当前最佳为 Claude Opus 5 的 92%),但成本比 Opus 低 60%;Grok 4.6 的 Rails API 回忆率为 33.3%,排第三。Claude Opus 4.8 以 3 分 36 秒位居速度第二,仅落后最快的 Luna 7 秒。Gemini Flash 3.7 各项表现中下,但属于较便宜的选项。
「模型」频道最新
- 腾讯发布 UI-Mate-27B,支持桌面 GUI 智能体操作 — tencent · 2026-08-24
- Sakana AI 翻译模型日英评测超越 Google 与 DeepL — SakanaAILabs · 2026-08-24
- 不服 theo 的模型梯队榜,开发者 haider 自制一份自己的版本 — haider1 · 2026-08-24
- 神秘OxAlpha碾压Claude,阿里800亿港元押注AI — 创业邦 · 2026-08-24
- OpenAI谷歌掀大模型降价潮,智谱神秘模型碾压Claude — 创业邦 · 2026-08-24
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24