「AI 研究品味每 3 个月翻倍并超人类专家」遭质疑:是否只是刷榜?
burny_tech · x · 2026-10-06
P-Zero Research 声称 AI 的「研究品味」自 2025 年 12 月起每 3 个月翻一倍,现已超过人类专家基线。burnytech 对此提出三连质问:
- 这个结论如何评测的?
- 有多大把握它不是 benchmaxxed(针对基准刷出来的)?
- 其中多少是目标明确、可验证的固定任务,多少是目标模糊、验证信号不清的开放性研究问题?
这一质疑点中了当前「AI 能力量化」研究的通病:开放性研究品味难以客观验证,评测口径决定结论可信度。
所属事件:AI研究品味每3个月翻倍说法遭质疑被指只是刷榜(2 条相关)→
「模型」频道最新
- EmbeddingGemma 2 禁用 FP16:激活超动态范围,会 NaN 或静默降质 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 降维实测:128d 缩 6 倍但质量明显下降 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 代码检索提升 14%,多语言小幅领先一代 — tomaarsen · 2026-10-07
- 让模型从零构建角色创建器:能跑通但仍需打磨 — flowersslop · 2026-10-07
- Google 收紧 Gemini 免费额度:10 月 9 日起免费用户仅剩 Flash Lite — stockduty77 · 2026-10-07
- Mistral Large 4 仅用 4000 块 GPU 训练,竞品 Astra 用了 10 万块 — steipete · 2026-10-07