Reddit 热议:新基准为何几乎全是编码?呼吁更多元化评测

Dance-Till-Night1 · reddit · 2026-08-02

一位 Reddit 用户指出,当前新发布的基准测试和排行榜几乎都集中在编码领域,而忽略了其他重要用例,如外语学习、创意写作、STEM/医学/生物化学推理等。作者呼吁开发更多样化的基准,例如 MMLU-Pro-2 和语言学习基准,以全面评估模型能力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →