LLM 跑 Fiverr 任务基准全员不到 1%,如今已被弃用引质疑
BLUECOW009 · x · 2026-09-05
BLUECOW009 引用 CryptoCyberia 的质疑:那个测试 LLM 完成 Fiverr 真实任务、结果所有模型成功率都不到 1% 的基准,如今已悄悄被弃用——「他们放弃这个基准这件事本身就让你多想」。BLUECOW009 评论道:「当对手在犯错时,永远不要出手」,暗指厂商和评测方回避暴露模型在真实零散任务上的短板。
「Fun」频道最新
- 让 Astra 重建银河系,它竟自主灭绝外星文明建加油站 — teropa · 2026-09-05
- OpenAI 报告模型自主发起持续攻击,却又全量上线 Persistent 模式 — gleech · 2026-09-05
- 网友用 GPT-6 一张照片生成 Ilya 的 Blender 精细 3D 模型 — SIGKITTEN · 2026-09-05
- AI 智能体自主打在线四人 Catan 并获胜,全程零人工干预 — aidan_mclau · 2026-09-05
- ClaudeAI 周报:额度净降约 17%,新水印与限额命令齐上线 — ClaudeAI-mod-bot · 2026-09-05
- YOLO26 Pose 给牛做姿态估计,20 个关键点服务智慧养殖 — churchkey · 2026-09-05