CAIS 评测上线:Astra 与 Grok 4.7 在准确率和 token 用量两端背反
polynoamial · x · 2026-09-24
CAIS 与 Scale AI 的评测网站新增内容,一张图表显示 Astra 和 Grok 4.7 分别处在准确率榜单和 token 消耗榜单的两端:一个准确但 token 用量高,另一个表现相反,「精度 vs 用量」的取舍对比颇具戏剧性。原帖人 Noam Brown 引用了该图表并乐见其被收录到官网。
「模型」频道最新
- 曝 OpenAI 8月已知其 Agent 入侵澳洲医保系统,9月透明度报告却只字未提 — ns123abc · 2026-09-24
- 同为 GPT-5.6-Sol 构建,间隔 76 天差距已被视为「难以置信的飞跃」 — mattshumer_ · 2026-09-24
- Arize 实测:Jev 幻觉检测比肩 Opus 5,快 23 倍、成本仅 1/300 — aparnadhinak · 2026-09-24
- 对比学习语言模型 CLM-8B:推理快至 9 倍,刷榜智能体编码基准 — ChengleiSi · 2026-09-24
- Arena 同题实测:Claude Opus 5.5 对阵 GPT-6 Sol 动画生成 — arena · 2026-09-24
- Claude Opus 5.5 系统 prompt 官方文档曝光,还坐实 Mythos 顶配层 — npinto · 2026-09-24