Every 弃纯榜单:用真实工作自建个人基准评新模型
danshipper · x · 2026-09-12
Every 的 Dan Shipper 指出 benchmark 分数说明不了模型在你真实工作上的表现,因此三年来的做法是「vibe checks」——基于团队真实工作的上手长文评测。现在团队更进一步:hammermt 和 nityeshaga 搭了内部平台,让每个人基于自己日常工作构建个人化基准,把主观 vibe check 量化。
所属事件:Every弃公共榜单,为每位员工建个人基准测模型(2 条相关)→
「模型」频道最新
- Zed CEO 晒图:一条链接耗掉约一半 Claude 订阅额度 — zeeg · 2026-09-12
- 演示称 GPT-6 Astra 可实现视频生成精确相机控制 — round · 2026-09-12
- Burkov 批评某模型视觉推理仍弱于 Luna 与 Gemini Flash — burkov · 2026-09-12
- Burkov 用分类器维护经验类比:RL 修好一处,别处就崩 — burkov · 2026-09-12
- GPT-Live-1 可同时听说、GPT-image-2.5 跨轮修图,交互转向实时协作 — WirelessLife · 2026-09-12
- 只看 pass/fail 分数已无法解读评测:隐藏测试过严致大量误判 — trq212 · 2026-09-12