长文质疑 Opus 5.5 基准可验证性:厂商既当运动员又当裁判
maier_ak · x · 2026-10-02
Andreas Maier 长文指出核心问题:托管模型的质量可以由卖方通过管理手段调节,而买方无法观测,这不需要任何故障或恶意即可发生。文章梳理 Anthropic 近期发布节奏:Opus 4.7(4月16日)上线后被反映拒绝率过高,当月 Claude Code 收到创纪录的 35 起无理由拒绝报告;42 天后即发 4.8;Opus 5(7月24日)一周内被抱怨答案冗长、小 bug 重写大段代码、审查成本超过节省;60 天后又发 5.5。作者强调并非指控造假,而是:发布页回答的是公司外部无人能验证的问题,且这不是媒介的偶然,而是「允许客户观测什么」决策的结果。他提出低成本的审计方案:固定快照、每列声明计算投入、由非卖方每天跑独立 held-out 测试套件。
要点
- 发布页数据清晰具体,但全部由卖方自己测量,无第三方可复现
- 5.5 降价(输入 5→4、输出 25→20 美元、缓存读降 60%)反驳「削弱旧款促升级」阴谋论
- 但宣称「运行成本降 40%」意味着节省来自压缩深思过程
- 建议行业建立廉价独立验证机制
所属事件:Opus 5.5 基准遭质疑:厂商自测可信度引热议(3 条相关)→
「模型」频道最新
- 最新模型已极擅长读二进制,所有游戏将「事实上开源」 — bradneuberg · 2026-10-02
- Ajeya Cotra 复盘 2026 十项预测:「策划生日派对」已提前落空 — ajeya_cotra · 2026-10-02
- Pi 1.0 与 Pi Durable 登 HN 热榜:Gemini 4 Argon、GPT-6.1 Sol、FLUX 3 齐发 — Latent Space · 2026-10-02
- Cantina 发布开源权重安全研究模型 apex-flash-1,用真实漏洞数据后训练 — ctjlewis · 2026-10-02
- 社区上传 GLM-5.3 无审查量化版 EXL3 3.0bpw 到 Hugging Face — kevinnbass · 2026-10-02
- GPT-6.1 Sol 本周分阶段登陆 Copilot,ChatGPT 版或临近 — koltregaskes · 2026-10-02