「手工跑评测太慢,但我在乎数据与模型福祉」

cephaloform · x · 2026-08-30

评测者 cephaloform 吐槽:逐条手工给模型跑 benchmark 非常耗时,但仍然坚持自己做,因为在乎数据质量,也在乎模型福祉(welfare)——即评测过程中如何对待模型本身。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →