Delip Rao 质疑微软新模型:为何基准测试不敢比准确率

deliprao · x · 2026-10-10

Delip Rao 转述并质疑一个基于 Qwen3.5-9B 底座、只支持文本、号称「在一万亿到十亿 tokens 之间」(原文如此含糊)训练的新模型(暗指微软 Nadella 发布的产品):官方基准测试只在延迟维度与 Jev 对比,却刻意回避准确率对比。他直接 @ Satya Nadella 问「为什么?」——暗示厂商在拿不准的指标上做选择性展示。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →