博主指出:多份基准测试的多数错误源自评测本身而非模型
zainhas · x · 2026-09-16
博主 zainhas 评论一份分析,称大量基准测试中出现的「模型错误」其实多数是基准题本身或评分器的错误,而非模型能力问题——「错误来自评测房子内部」。这呼应了社区对 LLM 评测可信度、grader 噪声的持续质疑。
「模型」频道最新
- 近 100% 通过率:先取有效结果再反向造题的合成数据妙招 — tokenbender · 2026-09-16
- OpenArt Arena 按任务类型排名图像视频模型,称通用榜单无意义 — azed_ai · 2026-09-16
- 重度用户对比 Claude 与 ChatGPT:一个像伙伴思考,一个照单执行 — Lower-Delivery-8492 · 2026-09-16
- OpenRouter 用户上周 OpenAI 消费反超 Anthropic,2.5 年来首次 — firstadopter · 2026-09-16
- 研究发现知识蒸馏在 mid-training 阶段牺牲事实记忆换推理 — LukeZettlemoyer · 2026-09-16
- Anthropic 发布 154 页报告,揭露 Claude 被黑客与竞争对手滥用细节 — Fireship · 2026-09-16