同一厂商自评自家模型:Opus 5.5 基准数据能信几分
maier_ak · x · 2026-10-02
作者转发自己的长文《Both Columns, One Vendor: What the Opus 5.5 Benchmarks Can and Cannot Show》,讨论 hosted 模型的质量可以由卖方通过管理手段(而非技术手段)调节,而买方无法观测这一控制项,质疑 Anthropic 发布页上基准数据的可验证性。
所属事件:Opus 5.5 基准遭质疑:厂商自测可信度引热议(3 条相关)→
「模型」频道最新
- 自适应努力是动态循环 Transformer 的杀手级应用 — willcb · 2026-10-02
- 开发者抱怨 Claude 与 Claude Code 越用越差,质量下滑引共鸣 — Pavan_Belagatti · 2026-10-02
- 无审查版 Abliterated Large V2 上线 Venice,面向安全研究匿名开放 — 0xAllen_ · 2026-10-02
- GLM 5.3 登陆 Cursor,Max 版登顶 CursorBench 4.0 开源模型榜首 — zainhas · 2026-10-02
- Anthropic 封号潮下 200 刀订阅难退款,网友求退款攻略 — lxfater · 2026-10-02
- RSI-Exam 榜单:Claude Opus 5.5 以 0.536 登顶力压 GPT-6 — HuaxiuYaoML · 2026-10-02