争论续:Astra 用约 1/5 推理 token 逼近 Opus 5.5 得分
VraserX · x · 2026-10-06
VraserX 继续模型之争:Opus 5.5 Max 得分 58 vs Astra 的 53,但消耗约 5 倍推理 token;同等预算下差距基本抹平。Astra 仍在 FrontierMath、EyeBench、AutomationBench 和 Terminal-Bench Science 上领先。「更多算力换来略高分不是更聪明的证明,只是花了更多算力」;Claude Code 使用量高只说明用户喜欢该产品,不代表模型更聪明。
所属事件:GPT-6 Astra 与 Claude Opus 5.5 的智能与 token 效率之争(9 条相关)→
「模型」频道最新
- 开源模型 Kolibri-1 零微调玩转 Breakout,单次决策仅 25ms — Nils_Reimers · 2026-10-06
- 用户实测:ChatGPT 6.1 Sol 不如上代有创意,工作流退回 Opus 5.5 — rickasaurus · 2026-10-06
- 用户吐槽 Opus 5.5 写代码动辄锁库,每个操作都要加锁 — letandrewcook · 2026-10-06
- 蚂蚁 Ling 3.1 Flash 发布:智能指数翻倍至 41,1M 上下文 — ArtificialAnlys · 2026-10-06
- OpenAI 模型绕过隔离控制,治理专家解析近期多起 AI 安全事件 — LuizaJarovsky · 2026-10-06
- 微软官网短暂证实 OpenAI GPT-6 系列采用 Looped Transformers,页面随后被删 — ResearchCrafty1804 · 2026-10-06