Opus 4.8 推理密度暴增:Token 消耗达前版 6 倍
jyangballin · x · 2026-07-30
开发者针对 ProgramBench 的帕累托前沿分析引入了以 Token 数为横轴的评估视角。数据显示,Opus 4.8 在执行任务时展现出截然不同的行为模式:
- 轮次更少:完成任务所需轮次从 4.6 版的 259 次和 4.7 版的 159 次,大幅下降至 145 次。
- 推理更密:单轮生成的 Token 数激增至 1865 个,相比 4.7(613)和 4.6(343)提升了 3 至 6 倍。
这表明该模型正朝着“减少交互轮次、单轮深度思考”的方向演进。
「模型」频道最新
- 开发者吐槽Claude Opus:聪明但缺乏严谨性,只爱干想干的活 — heyneighbor · 2026-07-30
- OpenAI 称 GPT-5.6 Sol 实现自我优化:服务成本降 20% — OpenAI · 2026-07-30
- 逆向工程揭秘:Claude 分词器的奇特机制与异常行为 — soldni · 2026-07-30
- 开发者实测 Kimi K3:推理过程全透明成显著优势 — doodlestein · 2026-07-30
- 开发者利用 Grok 搭建验证群,低成本实现并行 Agent — rudrank · 2026-07-30
- 研究者发现 Claude Opus 5 基础模型模式存在异常叙事倾向 — repligate · 2026-07-30