Opus 5 在 Boeing 基准上加入数值自检
victormustar · x · 2026-07-25
- 这条说,一段对比视频更直观地展示出:Opus 5 在 Boeing benchmark 上做出的结果比 Fable 更细。
- 引用中的基准说明写到,Fable 5 花了 42 分钟,产出约 4 个文件 / 1000 行代码,主要靠 Puppeteer、12 个相机预设、17 次渲染和 54 次截图检查完成验证。
- Opus 5 则花了 71 分钟,扩展到 20 个模块 / 4000 行代码,并额外使用 measure.mjs 从运行中的场景里抽取几何量。
- 这个工具会测 14 个机体指标,包括翼展、轮距、翼根前缘站位、后掠、上反角、起落架轨距等,再和公开的 747-400 参数按容差对比。
- 图文合起来的重点是:Opus 5 不只是“看起来像”,而是在尝试数值化自检生成结果。
所属事件:对比视频显示 Opus 5 飞机渲染细节更精细(2 条相关)→
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11