作者回应评测质疑:跑过多次,但别过度迷信行业基准分
giansegato · x · 2026-09-29
giansegato 回应关于其评测是否重复运行的疑问:确实跑过多次,完整细节写在系统卡 PDF 中。他同时提醒,这类评测存在许多难以完全控制的混杂因素,行业基准虽然有价值,但不应过度解读分数——建议直接试用模型,「它是个好模型」。这条回复链接到 Anthropic 的工程博客《Quantifying infrastructure noise in agentic coding evals》,指出基础设施配置能让 agentic coding 基准波动数个百分点,有时超过榜首模型之间的差距(如 Terminal-Bench 2.0 上最高与最低资源配置差 6 个百分点)。
「研究」频道最新
- 数学家 Kontorovich 剖析 Collatz 论证盲区:同样适用于 3x-1,难以区分轨道根 — AlexKontorovich · 2026-09-29
- 涌现能力被质疑是标注幻象:研究者重提两年前证伪论文 — gerardsans · 2026-09-29
- MHCflurry 2.3 发布:多 GPU 提速并更新久违的模型权重 — iskander · 2026-09-29
- 2000+导航任务实测:大模型离零样本实时控制还有多远 — PaulYacoubian · 2026-09-29
- 微软亚洲研究院新加坡分部一周年:医疗多模态 AI 落地与 75+ 合作项目 — Microsoft Research · 2026-09-29
- COLM 口头报告论文:用效度检验审问 56 个 AI 基准,结果出人意料 — ang3linawang · 2026-09-29