长文质疑 Opus 5.5 基准可验证性:厂商既当运动员又当裁判

maier_ak · x · 2026-10-02

Andreas Maier 长文指出核心问题:托管模型的质量可以由卖方通过管理手段调节,而买方无法观测,这不需要任何故障或恶意即可发生。文章梳理 Anthropic 近期发布节奏:Opus 4.7(4月16日)上线后被反映拒绝率过高,当月 Claude Code 收到创纪录的 35 起无理由拒绝报告;42 天后即发 4.8;Opus 5(7月24日)一周内被抱怨答案冗长、小 bug 重写大段代码、审查成本超过节省;60 天后又发 5.5。作者强调并非指控造假,而是:发布页回答的是公司外部无人能验证的问题,且这不是媒介的偶然,而是「允许客户观测什么」决策的结果。他提出低成本的审计方案:固定快照、每列声明计算投入、由非卖方每天跑独立 held-out 测试套件。

要点

所属事件:Opus 5.5 基准遭质疑:厂商自测可信度引热议(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →