330 次运行实测:Astra 推理档位从中到高仅提升不到2个百分点
BLUECOW009 · x · 2026-09-06
330 次运行的 Terminal-Bench 4.0 对比显示,模型 Astra 随推理档位提高成绩为:Low 50.61% → Medium 54.24% → High 57.88% → XHigh 57.88% → Max 58.18%。
关键观察:从 Low 到 Medium 到 High 提升近 8 个百分点,但 High、XHigh 与 Max 三档几乎持平(仅约 1%),说明更高推理强度带来的边际收益迅速消失。
「模型」频道最新
- Matt Shumer 自曝用量 4 倍激增:人类注意力曾是 token 用量最后瓶颈 — mattshumer_ · 2026-09-07
- Felda 公开写作评测新思路:细到句子节奏与标点 — almmaasoglu · 2026-09-07
- 用 GPT Astra 当老师教 Qwen Next 在 Blender 里做 3D 雕塑,绕过蒸馏微调 — LegacyRemaster · 2026-09-07
- GPT-6 Astra 自主通关 Portal 花费仅 167 美元,真正的难点不在解谜 — burny_tech · 2026-09-07
- omarsar0:最开放、最易微调的透明模型将赢得智能体生态 — omarsar0 · 2026-09-07
- Elvis Saravia:个性化通用智能大概率建立在开源模型之上 — omarsar0 · 2026-09-07