AI 编码评测暗箱操作?闭源模型被指刻意隐瞒成绩
astralmatrix · x · 2026-08-13
近期 AI 编码模型的评测榜单引发争议。有开发者指出,某家与 CursorBench 评测平台关系密切的公司,其模型在自家生态的评测中表现极佳(达到 fable 级别),但在第三方独立测试集 DeepSWE 上却表现糟糕。
这引发了行业对评测公正性的质疑:究竟是两个测试集侧重点不同,还是存在利益相关的暗箱操作?更有评论者尖锐指出,如果编码评测基准不公开透明,整个跑分体系就失去了意义,呼吁厂商向世界公开真实的评测细节。
「模型」频道最新
- 特斯拉工程师实测:Grok 4.6 成日常主力,图像处理极佳 — aman_madaan · 2026-08-13
- xAI 发布 Grok 4.6,首发登陆 Cursor 与 API — aman_madaan · 2026-08-13
- xAI 高管暗示 Grok 4.5 将至:主打编码智能体 — aman_madaan · 2026-08-13
- 网友猜测:Grok 4.6 是 Kimi K3 的微调版? — robertpro01 · 2026-08-13
- Grok 4.6 登顶多项知识与法律生产力评测 — elonmusk · 2026-08-13
- DeepSeek V4 Pro 被指在 Agentic Coding 中易早停 — karminski3 · 2026-08-13