评测 AI 助手别只看生成速度:检查时间才是隐藏大头

OriginalHospital · reddit · 2026-09-10

作者提出一个小型 AI 助手对比方法:先定义「完成」,再跑提示词——答案出现在屏幕上是一个事件,可直接使用的结果是另一个。

虚构示例:助手 A 一分钟出稿但需 14 分钟检查修正,助手 B 生成 4 分钟、审校 3 分钟;若秒表停在生成时刻前者更快,但后者更早到达真正的终点。对基于来源的摘要,「完成」可定义为每条事实都对照文档核过、保留重要注意事项、输出符合目标受众。

让小型对比更可信的做法:用相同素材和验收标准、统计失败次数、不给某个助手额外上下文或重试、审校时隐藏模型名并轮换审校顺序(先查第一个答案会顺便学会素材,使第二个更易评)。作者强调应分别报告生成时间与人工审校时间及剩余错误,而不是把小型测试包装成通用排名。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →