实测 Sol 6.1:基准满分且 token 消耗仅为 6 代一半
startassets · reddit · 2026-09-30
社区评测者对 Sol 6.1 做了基准测试,结论是它「可能是 Sol 6 本该有的样子」。
- 背景:Sol 6 发布时宣称 API 成本降 50%,但真实性能明显下滑,多个基准已证实;$200 套餐额度缩减雪上加霜
- 实测:Sol 6.1 轻松拿下 100 分的基准得分,速度快、精度高,且所用 token 只有 Sol 5.6 和 Sol 6 的一半
- 待验证:作者关注它在真实任务(非基准)下的表现,以及额度消耗速度;测试时 Pi 平台尚未支持该模型,是手动添加的,完整成本数据将在后续补跑
这是社区驱动的基准项目,欢迎其他贡献者提交运行结果。仓库在 GitHub,数据集查看器托管在 Hugging Face Spaces。
「模型」频道最新
- 用户抗议能否让 Anthropic 撤回 Pro 200x 额度腰斩? — Kakachia777 · 2026-09-30
- Claude Chat 仍停留在 Sol 5.6,确认 6.1 不会上线 — throwawaysusi · 2026-09-30
- Grok Bot 支持自定义头像:上传图片或一句话生成 — XFreeze · 2026-09-30
- 2bit 量化本地模型识破逻辑陷阱,反把前沿云模型考倒 — HolidayBit143 · 2026-09-30
- 实测发现 Claude「免费额度重置」按钮仅 Max 计划可用,Pro 不含 — ThePeterMick · 2026-09-30
- Three.js 程序化猎豹实测:GPT 6.1 Sol Max 对比 Opus 5.5 Max — majidmanzarpour · 2026-09-30