Every为每位员工建个人基准:你的品味就是测试数据
danshipper · x · 2026-09-19
Every CEO Dan Shipper 提出:公开基准测不出模型懂不懂「每页 PPT 只放一个观点」这类个人标准,解法是为每位员工建立 personal benchmark——用你自己的好标准给模型打分。
- Astra 和 Fable 5.1 在研究生级科学考试上分别拿了 96% 和 93%,但与实际工作帮助的关系不明。
- 主编 Kate Lee 的基准沉淀了她对文案编辑的判断(逗号位置、用词等);评测负责人 Mike Taylor 用自己「做 deck」的基准验证了更小的模型也能胜任大部分日常工作。
- 文章给出五步工作流:把你在日常使用中给出的修改意见,转化成可复用的 eval,用来给任何模型打分。
核心主张:「Public benchmarks cannot tell you… Turn your corrections into evals. Your taste is test data.」
「编程与Agent」频道最新
- 临床 agent 99 次调用 14 万 token 仅花 0.0047 美元,开发者实测低成本分诊流 — MaziyarPanahi · 2026-09-19
- Alchemy IaC 框架将支持 Doppler/Infisical 等密钥管理器 — samgoodwin89 · 2026-09-19
- Swarms v16 将推 MCP Deployer,5 行代码把智能体变成 MCP 服务器 — KyeGomezB · 2026-09-19
- 让 Agent 自己部署应用、再当真实用户测试,像高级模糊测试 — lucasmeijer · 2026-09-19
- 开发者经验:禁止 fallback,逼模型把核心功能做对 — Daniel_Farinax · 2026-09-19
- 银行仓库接 AI 问答三个月复盘:模型从来不是难点 — the_darkest_horse · 2026-09-19