Grok 4.7 发布后,Reddit 提议按「每可用任务成本」而非 token 价评估模型
Crescitaly · reddit · 2026-09-22
xAI 于 9 月 21 日发布 Grok 4.7,官方称其改进了长时运行任务与自我检查能力,同时保持 Grok 4.6 的基础价格与速度。
发帖人认为,对研究与营销类工作,榜单排名意义有限,更有用的对比方式是:给各模型同样的带来源依据的简报任务,统计结果可用前需要多少人工清理——包括无依据论断数、遗漏需求、返工轮次、耗时与总用量,并在测试前固定成功标准。核心论点是「更便宜的 token 单价不等于更低的完成任务成本」。
作者明确声明这只是提议的测试方案,并非已跑出的实验结果,也未声称 Grok 表现更好。
「模型」频道最新
- GPT-6 Astra 每百万输出 $50 vs DeepSeek $1.20,前沿智能其实很便宜 — alex_verem · 2026-09-22
- 小米发布 MiMo-V2.6-Distill-Qwen-9B 蒸馏模型 — Aggravating-Push-207 · 2026-09-22
- 爆料称千问将迈向 5-10 万亿参数,RSI 递归自我改进引关注 — lxfater · 2026-09-22
- 小米 MiMo 2.6 Pro 协助完成李-约克定理 Lean 形式化,超 6000 行代码 — bookwormengr · 2026-09-22
- 首个古希腊语大模型 Apollo 诞生,专修残破莎草纸文献 — nordicinst · 2026-09-22
- Two Minute Papers 解读 Jev:宣称让 AI 提速 200 倍但有代价 — Two Minute Papers · 2026-09-22