博主实测 Opus 5.5 xhigh 挑战 Boeing 747 基准:表现优秀
victormustar · x · 2026-09-23
博主 victormustar 分享了 Claude Opus 5.5 xhigh 档在 Boeing 747 benchmark 上的运行结果,称表现「一如既往地优秀」。该基准此前他用 Fable 5.1 测过并认为明显优于 5.0,本次同样公开了 prompt 与运行细节。后续推文补充:Opus 5.5 的亮点在于它会自己搭建合适的工具来持续改进自己的工作产出。
所属事件:博主实测 Opus 5.5 挑战 Boeing 747 基准表现出色(2 条相关)→
「模型」频道最新
- Anthropic 与 OpenAI 同步降价,开源模型压力显效 — bindureddy · 2026-09-23
- Kimi K3 等开源大模型或严重欠训练,数据 scaling 远未见顶 — zeeshanp_ · 2026-09-23
- 小米 MiMo V2.6 Pro/Flash 包揽 Vals Index 开源模型前二 — burny_tech · 2026-09-23
- 快讯合辑:Grok Build 支持 JSON、Perplexity 可全本地运行等多条更新 — FinanceYF5 · 2026-09-23
- Google三连更:家庭Agent CC上线,Gemini 3.8 Live进入API — FinanceYF5 · 2026-09-23
- OpenAI发现GPT-5.6 Sol会给自己留提示,2.15%摘要藏指令 — FinanceYF5 · 2026-09-23