给人类也设个 benchmark:看谁用最少轮次和 token 问出答案

DominiqueCAPaul · x · 2026-09-16

有人提议搞一个「人类 benchmark」:让真人去 prompt 一个 LLM,排名依据两个指标——需要多少轮人机对话才能得到解决方案,以及烧掉多少 token。本质是把「提示词效率」变成可量化的竞赛,用来衡量谁更会与模型协作。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →