Opus 5 在 Boeing 基准上加入数值自检
victormustar · x · 2026-07-25
- 这条说,一段对比视频更直观地展示出:Opus 5 在 Boeing benchmark 上做出的结果比 Fable 更细。
- 引用中的基准说明写到,Fable 5 花了 42 分钟,产出约 4 个文件 / 1000 行代码,主要靠 Puppeteer、12 个相机预设、17 次渲染和 54 次截图检查完成验证。
- Opus 5 则花了 71 分钟,扩展到 20 个模块 / 4000 行代码,并额外使用 measure.mjs 从运行中的场景里抽取几何量。
- 这个工具会测 14 个机体指标,包括翼展、轮距、翼根前缘站位、后掠、上反角、起落架轨距等,再和公开的 747-400 参数按容差对比。
- 图文合起来的重点是:Opus 5 不只是“看起来像”,而是在尝试数值化自检生成结果。
所属事件:对比视频显示 Opus 5 飞机渲染细节更精细(2 条相关)→
「模型」频道最新
- Bug Hunt Bench 实测:GPT-5.6 Sol 修复 22 个 bug,Opus 5 修复 12 个 — PawelHuryn · 2026-07-25
- Claude Opus 5 用 27% 订阅额度做出赛车克隆 — soumitrashukla9 · 2026-07-25
- 转发帖质疑 Claude 基准图只挑出 GPT-5.6 Sol 唯一赢项 — soumitrashukla9 · 2026-07-25
- Opus 5 基准图曝光,编码、搜索和电脑操控全面领跑 — CtrlAltDwayne · 2026-07-25
- SlopCodeBench 实测里 Opus 5 领先 Opus 4.8 和 Sonnet 5 — HamelHusain · 2026-07-25
- 新模型实测:速度与性价比兼具的 Agent 主力 — doodlestein · 2026-07-25