为验证一个模型实测 16 家:一个任务构不成基准
AlexKim · x · 2026-09-19
作者为判断 TypeSafe 的 Jev 是否值得加入自己的技术栈,实测了 16 个模型,结果 Jev 准确率只排第 10。他分享了写结论的过程:初稿写「Haiku 更准」,这只在一个任务上成立;加测两个任务后结论变成平分秋色——Haiku 在业务类目上以 83.2 比 79.9 领先,Jev 在提交类型上以 50.0 比 42.0 胜出,散文类 66.0 打平。他的教训:一个任务构不成基准,标题要等数据 surv过后才能定。
所属事件:16 模型校准实测:Jev 快而诚实但准确率仅列第10(8 条相关)→
「编程与Agent」频道最新
- GitHub 开直播教 Copilot SDK:不用自己写 agent 循环即可构建智能体应用 — 0xkarasy · 2026-09-19
- Stripe 开放 Muse 连接器开发,用户一句需求即可触发 agent 自动付款 — jeff_weinstein · 2026-09-19
- AI 玩转 Subway Surfers:超人类速度同时开 50 局,单局不到 1 美分 — ravithejads · 2026-09-19
- 用户给 Codex 提功能建议:加个线程用量面板看清每周额度都花在哪 — CtrlAltDwayne · 2026-09-19
- 企业 IT 运维盼自主 Agent:Copilot 不顶用,谁来接管 RMM 告警? — PerfectReflection155 · 2026-09-19
- Flet 1.0 登上 HN 首页:用 Python 构建全平台应用引热议 — dhruv2038 · 2026-09-19