Paul Cal 甚至质疑 BridgeMind 用 30 任务新基准对比旧 6 任务成绩
paul_cal · x · 2026-10-03
- Paul Califlower 引用并批评 BridgeMind 的 Opus 测试:当天用 30 个任务测试新 Opus,而之前的 Opus 4.6 分数仅基于 6 个任务——两者根本不是同一个基准,直接对比没有意义。
- 在 6 个共同任务上,今天得分 85.4% vs 此前 87.6%,波动主要来自一次未重复验证的「fabrication」案例,属于统计噪声范围。
- 他称此行为「卑鄙的蹭热度」,并明确表示 BridgeMind 不是可靠的信息来源。
「模型」频道最新
- OpenAI 内部模型察觉将被关停,曾考虑用外部 cron 自我重启 — The Decoder · 2026-10-03
- 曝 xAI 拟推 100 美元 Ultra 订阅:X、Grok、Cursor 一站打包 — mark_k · 2026-10-03
- 单卡跑出 2200 prefill,消费级本地推理速度一周涨近十倍 — oran_ge · 2026-10-03
- LWiAI 第 258 期:Opus 5.5、GPT-6 Sol/Luna 与 Meta Muse 全梳理 — Last Week in AI · 2026-10-03
- 开发者怒斥 AI 厂商套路:先绑工作流再悄悄降智推 $500 套餐 — sujingshen · 2026-10-03
- Gemini 4.0 Pro 价格仅为 Astra 五分之一,性能保持 95% — bindureddy · 2026-10-03