新 Claude 模型实测:推理能力提升,思考 token 消耗巨大
kimmonismus · x · 2026-08-24
用户测试了疑似 Opus 5.1 的新 Claude 模型,发现在中等难度推理任务上表现优异,且在 3D 强化学习任务中表现良好。观察到一个显著特征是模型消耗了大量的“思考 token”,多次触达最大 token 限制。
「模型」频道最新
- 开源 Pelican SVG 环境,量化评估模型画图能力 — SergioPaniego · 2026-08-24
- 爆料称 Kimi K4 规模大幅升级,拟对标 GPT-6 — iamaliveix · 2026-08-24
- 连续扩散语言模型卷土重来,Sander Dieleman 长文梳理复兴脉络 — joao_gante · 2026-08-24
- 测评人暗示 OpenAI 正测试更强模型 — haider1 · 2026-08-24
- 实测 Minimax H3 模型:它能认出哪些游戏影视角色 — BoneDaddyMan · 2026-08-24
- 蚂蚁 Ling-3.0 开源:Tiny 与 Flash 两个尺寸,分三阶段释放检查点 — Affectionate-File-26 · 2026-08-24