马斯克力荐 Grok:真实任务基准表现大幅跃升
elonmusk · x · 2026-08-13
马斯克在 X 上发文,鼓励用户在复杂的真实世界任务中测试 Grok 模型。
他引用了 Emad Mostaque 的推文,后者指出 GDPVal 是衡量模型在真实任务中表现的最重要的基准测试。Mostaque 强调 Grok 在该基准上取得了巨大的性能飞跃并登顶,且价格极具竞争力,并对即将到来的更大规模发布表示期待。
所属事件:xAI发布Grok 4.6模型,跑分登顶且成本极低(27 条相关)→
「模型」频道最新
- 实测反馈:Grok 4.6 响应快且智能,能顺畅协同多智能体 — doodlestein · 2026-08-13
- xAI 发布 Grok 4.6 模型与 Grok Bot 智能体 — aman_madaan · 2026-08-13
- 开发者吐槽:Claude 应用体验太差,宁愿用稍笨的模型 — breath_mirror · 2026-08-13
- AI 圈奇景:各大模型厂商集体在日食当天「发新模」 — amplifiedamp · 2026-08-13
- 用户吐槽 Claude 思维链输出过长:强制展示过程影响体验 — GuyHachmon · 2026-08-13
- OpenAI 实时语音模型轮次检测近乎完美,攻克语音交互顽疾 — pbbakkum · 2026-08-13