VikParuchuri:基准测试低级错误被包装成新闻稿,应自行评估
VikParuchuri · x · 2026-08-15
VikParuchuri对基准测试中的低级错误被用于新闻稿和营销表示不满,强调应自行运行评估,不要轻信供应商基准。
所属事件:修复 LlamaIndex 评测 bug 后分数飙升(5 条相关)→
「研究」频道最新
- 未发布的 Model 2 得分62.8%,距全替代研究员仅差22.2% — ChrisGPT · 2026-08-15
- Anthropic水印技术基于Google SynthID,可参考其开源实现 — andy_l_jones · 2026-08-15
- Anthropic 引入 Epoch 基准,量化其 RSI 研究进展 — testingcatalog · 2026-08-15
- EGA-DMD 比 MIRT 快数千倍:新模拟显示估计速度提升显著 — GolinoHudson · 2026-08-15
- NYU 等提出“反事实公平性”因果推断框架 — burkov · 2026-08-15
- 自进化 Agent 易遗留隐患,新工具可隔离风险 — dair_ai · 2026-08-15