GPT Astra 推理耗时 38 分钟:高 Token 效率不等于低算力成本
___Patrice___ · x · 2026-08-30
针对 GPT Astra 输出 56k tokens 却耗时 38 分钟的现象,作者指出 Token 效率并不等同于算力效率。这暗示模型可能在生成每个 Token 时消耗了更多算力,以换取更好的质量或更少的 Token 总量。这种以算力换质量的策略将直接影响最终定价,引发对其商业化可行性的好奇。
「模型」频道最新
- 泄密:谷歌 Gemini 3.8 Flash 即将发布,质量显著提升 — mark_k · 2026-08-30
- GLM 5.3 Flash 评测:何时该选更便宜的模型? — Sam Witteveen · 2026-08-30
- GLM-5.3-Flash 编码成本较 GPT-5 降 26 倍,分数反超 — ccerrato147 · 2026-08-30
- Opus 5 被指术语泛滥,作者以此抨击 LLM 解释简单概念的能力不足 — antirez · 2026-08-30
- LongCat-Flash-Lite-Sparse 等多模型发布,支持百万上下文与稀疏注意力 — LLMFan46 · 2026-08-30
- 双 DGX Spark 跑 Qwen3.8-Flash-Next:解码 50t/s、预填充 2900t/s — -dysangel- · 2026-08-30