Claude Opus 5 登顶 LisanBench,medium 模式更省 token
scaling01 · x · 2026-07-29
这条帖子在说 Claude Opus 5 在 LisanBench 上的表现很强。
作者称,Opus 5 high 已经升到总榜第 1,但在 high 努力模式下会消耗比 Opus 4.8 更多的 token;而 Opus 5 medium 几乎追平 Opus 4.8 high,token 只有后者的一半左右。帖子还提到,Opus 5 不开思考 的成绩也接近 GPT-5-medium,而后者平均用了 3 万+ reasoning tokens,Opus 5 只用 510。
「模型」频道最新
- PostTrainBench v1.1 标记 234 次污染运行并强化反作弊 — scaling01 · 2026-07-29
- Nvidia 的 LatentMoE 论文刚发 6 个月就被用于预训练改造 — peterjliu · 2026-07-29
- 内部评测图比较各模型居中一个 div 要多少 token — BLUECOW009 · 2026-07-29
- 微软发布 Mage-VL:编码原生流式多模态模型,推理提速 3.5 倍 — pmttyji · 2026-07-29
- AI能力见顶?开发者激辩大模型正丧失通用性 — JacquesThibs · 2026-07-29
- 用户称 ChatGPT 复述了已删掉的 SSD 细节 — SpyrosFgs · 2026-07-29