前 Meta 研究员提醒:新模型旧榜强新榜弱是评测危险信号
rajammanabrolu · x · 2026-10-06
rajammanabrolu 指出一个选模型时的红旗信号:如果某新模型在很老的基准上表现远超同类,但在更新基准上没有相应优势,那么存在各种混杂因素(如数据污染、基准过拟合)的潜力要大得多。这条经验可作快速甄别评测水分的启发式。
「模型」频道最新
- 研究者提醒:正则脚本能刷爆 User Sim Index,勿当头条结果 — ericzelikman · 2026-10-06
- OpenAI 文本图像水印或损输出质量,Reddit 热议 KLD 累积效应 — ResearchCrafty1804 · 2026-10-06
- Z.AI 开源旗舰 GLM-5.3 上架 Amazon Bedrock:744B MoE、1M 上下文 — Zai_org · 2026-10-06
- Codex 出现神秘模型 Daybreak Blue,连模型自己都不认识 — 561Danny · 2026-10-06
- 32GB 显存实测 Qwen 3.8 27B:口碑与体验存在落差 — YeetHub · 2026-10-06
- Claude 拒绝帮用户删文件:因为「Anthropic 说不行」 — Aizkmusic · 2026-10-06