Astra 达 88% 碾压 Fable 5.1 的 33%,价格仅约四分之一
TansuYegen · x · 2026-09-06
发帖人公布的评测显示,在 INDUCTION 基准上 Astra 拿到 88%、接近任务饱和,而 Fable 5.1 仅 33%。数据来自同一批次 xhigh thinking effort 运行,残余批次仍在跑,最终数字可能上调。成本方面差距更刺眼:Fable 5.1 跑 4 轮共烧掉 3200 万输出 token 才换来 66 次成功 API 响应,Astra 总价仅约其四分之一。作者认为这暴露了『推理』宣传与实际表现之间的尴尬鸿沟。
「模型」频道最新
- OpenAI 与 Anthropic 模型同爱一个名字,写作基准现命名偏好 — almmaasoglu · 2026-09-07
- 五模型写作风格横评:平均句长远远不够 — almmaasoglu · 2026-09-07
- Felda AI 自建写作基准:细到标点与长短句节奏 — almmaasoglu · 2026-09-07
- Matt Shumer 自曝用量 4 倍激增:人类注意力曾是 token 用量最后瓶颈 — mattshumer_ · 2026-09-07
- Felda 公开写作评测新思路:细到句子节奏与标点 — almmaasoglu · 2026-09-07
- 用 GPT Astra 当老师教 Qwen Next 在 Blender 里做 3D 雕塑,绕过蒸馏微调 — LegacyRemaster · 2026-09-07