JevBench 作者回击:靠「感觉和信任」选模型是自欺
airesearch12 · x · 2026-09-29
JevBench 作者 @airesearch12 回应 @CompleteSkeptic 的观点(后者称公开 benchmark 完全跑偏、极易被刷分,选对任务比什么都重要):
- 他认为「靠 vibes 和信任」来选 System One 模型是笑话,或是在掩饰模型开发领域没有护城河。
- 承认 benchmark 不完美,但仍是目前最好的客观、科学代理指标。
- 强调 JevBench 刻意设计成无法被「benchmaxxed」:每次发布都更换指标与测试集构成,让模型厂商无法针对性训练。
- 他提到自己的 benchmark 站点还提供号称全球首个 benchmaxxing 分数。
本质是「公开评测 vs 主观体感」的路线之争。
「漫话AGI」频道最新
- 研究者驳“人类科学将沦为数学象棋”论:科学从来不是生成论文 — zouharvi · 2026-09-29
- 网友尖锐观察:前沿实验室呼吁监管,怕的其实是开源抢走数据源 — RileyRalmuto · 2026-09-29
- Patterson:人形机器人修隧道,街道将转入地下变公园 — davidpattersonx · 2026-09-29
- Dan Jeffries:递归自我改进难逃 S 曲线,AI 终将「有用但不神奇」 — Dan_Jeffries1 · 2026-09-29
- 研究者的观察:越聪明的人越少作弊,望AI也能如此 — gandamu_ml · 2026-09-29
- Patterson 断言:AGI 将同时取代脑力与体力劳动 — davidpattersonx · 2026-09-29