Steve Yegge 亲测 Opus 5.5 两周:精度追平 Fable,召回略逊
Steve_Yegge · x · 2026-10-03
知名开发者 Steve Yegge 分享使用 Opus 5.5 两周的体验,称其是一款非常出色的模型,在讲解与教学场景下明显优于 Fable。
他自己搭建的 eval 显示:
- 精度(precision):Opus 5.5 在他系统内的所有任务上可与 Fable 5.1 相媲美
- 召回(recall):略逊于 Fable
- 单点任务:两者基本持平
- 开放式任务:Fable 更常能发现并处理重要问题,视角更广
结论:他仍认为 Opus 5.5 极为出色,目前大部分日常工作已用它完成。
「模型」频道最新
- 博主横评 GPT-6 Astra 与 Opus 5.5:Anthropic 缺乏中端好模型 — eyishazyer · 2026-10-03
- 网友晒 GPT-6 「Astra Dots」自主用 Blender 建出整座 3D 宫殿 — 141_1337 · 2026-10-03
- SFT 泛化差因 off-policy 数据,改写专家轨迹可媲美 RL — a_karvonen · 2026-10-03
- 博主称 Opus 高强度使用太贵,未必明显强过 GPT-6 astra — haider1 · 2026-10-03
- 用户随口一问,Grok 自主开浏览器追踪头顶直升机轨迹 — mertdumenci · 2026-10-03
- 博主质疑 Tavus AI 数字人宣传:称过不了图灵测试还无法实测 — churchkey · 2026-10-03