Grok 4.5成本性能表现突出
aman_madaan · x · 2026-07-12
转发内容的核心观点是:没有任何单一自动化评测能完整覆盖模型的“可用性”,因为真实使用是一个涉及性能、速度和成本权衡的人机交互回路。
引用的实测结论称,Grok 4.5 在一系列评测中持续位居成本-性能 Pareto 前沿,而且包括一些开发阶段并未专门追踪的评测项;这被用来说明它具备较好的泛化能力,同时保留了成本优势。作者还呼吁大家实际使用并反馈,以便继续缩小“评测表现”和“真实有用性”之间的差距。
所属事件:Grok 4.5 评测:中高预算段性价比突出(5 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03