AI benchmark 营销太强了,已经像在伪装成研究
generativist · x · 2026-07-22
这条评论直指 AI 圈的 benchmark 营销 已经有些失控:很多人以为自己在认真做研究,实际只是看图表。
- 作者认为,很多营销最擅长的就是把自己包装成“不是营销”。
- 他的核心批评是,AI benchmark 图表经常被做得很不讲理,但又很容易让人误以为自己在客观评估模型。
- 这反映出一个更大的问题:评测呈现方式本身,已经深受营销话术影响。
「研究」频道最新
- RAND 发布首份算法洞察保护路线图 — Scobleizer · 2026-07-22
- 生数科技称通用世界模型将驱动视频、机器人和智能体 — 生数科技 · 2026-07-22
- SWE-Pruner Pro 证明编码 Agent 已会自己剪上下文 — rohanpaul_ai · 2026-07-22
- SkewAdam 将 MoE 优化器显存降 97.4%,6.78B 可放进 40GB GPU — Kooky-Ad-4124 · 2026-07-22
- 论文提出四个条件,定义语言模型何时算代码代理 — alex_verem · 2026-07-22
- 用 P² 谱特征向量和加权 k-means 做马尔可夫链分块 — michaelchchoi · 2026-07-22