antirez 炮轰编码评测基准质量低劣

Redis 作者 antirez 发文质疑主流编码评测基准,认为这些测试与模型真实世界表现严重不对齐,训练中的实际进展与基准成绩关系很小,题目大多质量低劣,主要只考察工具调用层面的摩擦。他建议人们亲自打开基准中的测试题查看质量,并推测各大 AI 实验室都拥有私有的内部基准,用于真正衡量模型是否变强。

2026-09-03 ~ 2026-09-03 · 2 条相关