OpenAI 员工建议:AI 产品团队应花 25% 以上时间自建评测
OfficialLoganK · x · 2026-09-22
OpenAI 的 Logan Kilpatrick 建议称,用 AI 构建产品的团队应把超过 25% 的时间花在制作 benchmark 上,并设法让模型厂商重视这些评测。他认为这是加速公司进展的最简单路径——通过自建评测倒逼底层模型针对你的用例改进。
「编程与Agent」频道最新
- Deel 内部工具 Akai 用录屏教学做费用审核,90 天增收 1.4 亿美元 ARR — LinusEkenstam · 2026-09-22
- 多智能体并行不只是快:N 代理同时跑 1 倍时间,某些问题反超单代理跑 N 倍 — DimitrisPapail · 2026-09-22
- Lex 创始人 Nathan Baschez 宣布加入 Notion,将打造人机协作思考空间 — nbaschez · 2026-09-22
- GitHub Copilot app 集成 Sentry canvas:从崩溃报告到修复 PR 一站完成 — mariorod1 · 2026-09-22
- 给自主 Agent 装上「睡眠」:疲劳按真实 token 成本计算,还会做梦 — Dzikula · 2026-09-22
- 开发者吐槽 AI 编码最大痛点:模型还是太蠢、太慢、太贵 — remilouf · 2026-09-22