研究者读模型 trace 后疾呼:LLM 评测现状需要认真反思

IanArawjo · x · 2026-09-16

hallerite 发推称,是时候认真讨论 LLM 评测(eval)的现状了:他在阅读模型运行 trace 时看到了「真正糟糕的内容」,暗示当前主流评测方式与模型实际表现之间存在严重脱节。原帖只有这一核心观点,未展开具体案例。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →