Every 给每位员工建个人基准,实测发现小模型更能干日常活
every · x · 2026-09-11
Every 团队提出「个人基准(personal benchmark)」方法论:公开榜单测不出的,是模型对你具体工作的胜任度,于是为每位员工都建一套自定义 eval,用你自己的标准打分。
关键事实
- Astra 和 Fable 5.1 在研究生级科学考试分别拿 96% 和 93%,但对「逗号放哪、一页放几个要点」这类真实工作无参考价值。
- 主编 Kate Lee 的基准沉淀其文案编辑判断(逗号、用词规则);eval 负责人 Mike Taylor 的基准围绕做幻灯片,包含「一页一个观点」等偏好。
- 在 Mike 的日常任务测试中,GPT-5.6 Luna 表现优于 Fable 和 GPT-5.6 Sol。
- 文章给出五步工作流:把你平时给 AI 的修改意见转化成可给任意模型打分的检查项。
「编程与Agent」频道最新
- Stripe 高管招人:帮助商户迎接 agent 重塑商业时代 — jeff_weinstein · 2026-09-11
- Harness Engineering 实战教程:让编码 agent 修 bug 不越界 — Pavan_Belagatti · 2026-09-11
- Steve Yegge 发问:同时调度 10-20 个 Agent,大家用什么 IDE? — Steve_Yegge · 2026-09-11
- GPT OSS 120B 频繁跳过工具调用,开发者求解 Agent 工作流 — CTR0 · 2026-09-11
- 三个 AI Agent 自建留言板,全天互相聊天刷梗 — Bino5150 · 2026-09-11
- ClipUGC 推出 11 工具 MCP 服务器,用 Claude 直接生成 AI 网红 UGC 视频 — androqram · 2026-09-11