Grok 4.7 发布后,Reddit 提议按「每可用任务成本」而非 token 价评估模型

Crescitaly · reddit · 2026-09-22

xAI 于 9 月 21 日发布 Grok 4.7,官方称其改进了长时运行任务与自我检查能力,同时保持 Grok 4.6 的基础价格与速度。

发帖人认为,对研究与营销类工作,榜单排名意义有限,更有用的对比方式是:给各模型同样的带来源依据的简报任务,统计结果可用前需要多少人工清理——包括无依据论断数、遗漏需求、返工轮次、耗时与总用量,并在测试前固定成功标准。核心论点是「更便宜的 token 单价不等于更低的完成任务成本」。

作者明确声明这只是提议的测试方案,并非已跑出的实验结果,也未声称 Grok 表现更好。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →