Benchwarmer 工具上线:自动纠正误导性 AI 评测图表,重算胜者
aronchick · x · 2026-09-11
一款名为 Benchwarmer(benchwarm.ing)的小工具走红,用于『评测图表改造』:粘贴基准测试截图或表格,它会读取数值、忽略来源的误导性样式(如用颜色强调掩盖真实排名),逐行重新计算每个 benchmark 的真正赢家,并排展示原图与修正后的可导出对比图。
设计理念包括:『颜色永远不能压过算术』、胜者按行计算、平局与缺失数据显式标注、保留原始来源/版本/条件与注意事项,并输出可编辑数据和审计 JSON。起因是一条法推看到中国模型评测图后惊呼『中国接触了外星科技』,aronchick 用该工具修正了那张图表,说明原图的视觉强调具有误导性。
「模型」频道最新
- DeepSeek-V4.1-Flash 评测得 40 分,胜过 DeepSeek-V4-Pro — scaling01 · 2026-09-11
- Meta 向全美成人免费开放 AI,媒体却只关心离职风波 — neil_chilson · 2026-09-11
- Redis 之父 antirez 亲手为 ds4 编辑器适配 DeepSeek V4.1 — backyard_tractorbeam · 2026-09-11
- DeepSeek-V4.1-Flash 上线 Fireworks:552B MoE 主打编码与智能体 — lqiao · 2026-09-11
- 重度用户抱怨:通过 Codex 用 Astra 太烧量,Pro 账号像 Plus — BLUECOW009 · 2026-09-11
- 微软月度补丁修复 974 个漏洞,多数由 AI 系统发现 — Distinct-Question-16 · 2026-09-11