研究者读模型 trace 后疾呼:LLM 评测现状需要认真反思
IanArawjo · x · 2026-09-16
hallerite 发推称,是时候认真讨论 LLM 评测(eval)的现状了:他在阅读模型运行 trace 时看到了「真正糟糕的内容」,暗示当前主流评测方式与模型实际表现之间存在严重脱节。原帖只有这一核心观点,未展开具体案例。
「模型」频道最新
- Code Arena 预告:榜首 GPT-6 Astra 对阵 Claude Fable 5.1 胜率今日公布 — arena · 2026-09-17
- OpenCode 免费开放神秘模型 Union-Alpha,主打 agentic coding — gaganghotra_ · 2026-09-17
- 神秘模型 Union Alpha 开放免费一周,主打编程智能体 — AiBreakfast · 2026-09-17
- 让人类走进模型生成的 3D 港口找错,GPT-6 Astra 压力测试法 — Lianhuiq · 2026-09-17
- 开放任务 RL 像「入轨即自由落体」:只看每 GPU 时间的进步量 — tensorqt · 2026-09-17
- LLM 新型幻觉:不懂也敢编计划,还难以被反驳 — generativist · 2026-09-17