内部评测:Grok-4.7 在 22 项知识工作任务中排第三,成本不足 5 美元
himanshustwts · x · 2026-09-22
作者对 Grok-4.7 在 22 个内部知识工作任务上进行了评测,覆盖工程、业务运营、金融和医疗领域。
主要发现:
- Grok-4.7 在评测表中排名第 3,总成本不到 5 美元;
- 在多文档政策推理与优先级处理方面表现出色;
- 擅长跨 CSV、JSON、Markdown 和电子表格的大型结构化审计;
- 能稳定按要求产出交付文件。
转发者调侃「SpaceXAI 排名赶上 DeepSeek V4.1 Flash」,并指出这背后是 Colossus 2 和 Cursor 的数据支撑。
所属事件:Grok-4.7 内部评测 22 项任务排第三 成本不足 5 美元(2 条相关)→
「模型」频道最新
- SemiAnalysis 称开源将死,但两个月内仍有 20+ 开源模型发布 — _lewtun · 2026-09-22
- Grok 4.7 网络安全实测:59% 召回,成本仅 GPT 竞品一半 — andreamichi · 2026-09-22
- Grok 4.7 在 BuildingBench 3D 建模榜从第 9 跳到第 3,得分 0.783 — ZhitingHu · 2026-09-22
- Jev 并非传统 LLM,作者撰文向普通人解释其设计原理 — multiply_matrix · 2026-09-22
- 单 token 就够用?开发者呼吁用具体 token 数取代高中低推理档位 — arkuto · 2026-09-22
- Grok 4.7 多次评测仅胜 4.6 0.1 分,作者判定属随机噪声 — PawelHuryn · 2026-09-22