Every 弃纯榜单:用真实工作自建个人基准评新模型

danshipper · x · 2026-09-12

Every 的 Dan Shipper 指出 benchmark 分数说明不了模型在你真实工作上的表现,因此三年来的做法是「vibe checks」——基于团队真实工作的上手长文评测。现在团队更进一步:hammermt 和 nityeshaga 搭了内部平台,让每个人基于自己日常工作构建个人化基准,把主观 vibe check 量化。

所属事件:Every弃公共榜单,为每位员工建个人基准测模型(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →