给人类也设个 benchmark:看谁用最少轮次和 token 问出答案
DominiqueCAPaul · x · 2026-09-16
有人提议搞一个「人类 benchmark」:让真人去 prompt 一个 LLM,排名依据两个指标——需要多少轮人机对话才能得到解决方案,以及烧掉多少 token。本质是把「提示词效率」变成可量化的竞赛,用来衡量谁更会与模型协作。
「编程与Agent」频道最新
- Supabase Select 26 大会官宣:Wozniak、Garry Tan、Anthropic 高管齐聚 — dshukertjr · 2026-09-16
- Capawesome 发布三个 MCP 服务器,解决 AI 编码过时 API 问题 — DayanaJabif · 2026-09-16
- Synthesia 推实时交互数字人 API,接入 LiveKit 三步上线 — synthesiaIO · 2026-09-16
- AI 五分钟迁移百页个人网站,替他省下每月 10 美元订阅 — thisiskp_ · 2026-09-16
- 开源跨工具 Agent 记忆层:一次学习、密封证明、跨平台迁移 — Neither-Witness-6010 · 2026-09-16
- 手机远程启动本机 Claude Code,自带 hooks/skills 完整配置 — TearInternational414 · 2026-09-16