评测 AI 助手别只看生成速度:检查时间才是隐藏大头
OriginalHospital · reddit · 2026-09-10
作者提出一个小型 AI 助手对比方法:先定义「完成」,再跑提示词——答案出现在屏幕上是一个事件,可直接使用的结果是另一个。
虚构示例:助手 A 一分钟出稿但需 14 分钟检查修正,助手 B 生成 4 分钟、审校 3 分钟;若秒表停在生成时刻前者更快,但后者更早到达真正的终点。对基于来源的摘要,「完成」可定义为每条事实都对照文档核过、保留重要注意事项、输出符合目标受众。
让小型对比更可信的做法:用相同素材和验收标准、统计失败次数、不给某个助手额外上下文或重试、审校时隐藏模型名并轮换审校顺序(先查第一个答案会顺便学会素材,使第二个更易评)。作者强调应分别报告生成时间与人工审校时间及剩余错误,而不是把小型测试包装成通用排名。
「编程与Agent」频道最新
- Stripe 工程实践:规格先行委派 AI,SDK 原型两周工期缩至两天 — dl_weekly · 2026-09-10
- Agent 写码不维护可读性,注入硬编码注释拖累代码库 — _Stocko_ · 2026-09-10
- Hy4 preview 实测:一条 prompt 产出可玩的 3D 生存游戏 — mhdfaran · 2026-09-10
- 网友分析 Astra xhigh 的 token 高效可能源于给子代理的指令 — Al_Grigor · 2026-09-10
- 论文披露 Agent Swarm RL 配方:V4.1 团队 ProgramBench 达 30% — inductionheads · 2026-09-10
- AI 代码维护成本 18 个月涨 300%,工程负责人批"让 Agent 蛮干" — bendee983 · 2026-09-10