Anthropic 一跑差分数,基准就更难让人信了
teortaxesTex · x · 2026-07-25
用一句梗话概括了这类基准分数的“信任危机”:只要 Anthropic 在某个 benchmark 上表现一般,大家就更容易怀疑这个 benchmark 没那么靠谱。
配图里是在讨论 Opus 5 的 ECI:有人认为它应在 163.5 左右,理由是基于公开基准和 Anthropic 自己给出的信息;图中还提到 内部 AECl 为 162.1,甚至高于 Mythos 5。原帖最后的意思是:公共基准还得更难一点,不然太容易被解读或被“玩”明白。
所属事件:Anthropic 基准测试表现引发社区信任危机(2 条相关)→
「Fun」频道最新
- Linus 并不用 GitHub 写内核:绿格子其实来自邮件列表工作流 — _jaydeepkarale · 2026-09-11
- AI 五年改变世界,Google Docs 却仍把「compute」当名词标错 — ohlennart · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- 网友上线「求 AI 别杀我」注册网站,黑色幽默拉满 — motionbynick · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 梗图:工程师周五下午放出上万个 Claude 子 Agent 清空一周工作量 — _jaydeepkarale · 2026-09-11