LLM 跑 Fiverr 任务基准全员不到 1%,如今已被弃用引质疑

BLUECOW009 · x · 2026-09-05

BLUECOW009 引用 CryptoCyberia 的质疑:那个测试 LLM 完成 Fiverr 真实任务、结果所有模型成功率都不到 1% 的基准,如今已悄悄被弃用——「他们放弃这个基准这件事本身就让你多想」。BLUECOW009 评论道:「当对手在犯错时,永远不要出手」,暗指厂商和评测方回避暴露模型在真实零散任务上的短板。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →