Delip Rao 质疑微软新模型:为何基准测试不敢比准确率
deliprao · x · 2026-10-10
Delip Rao 转述并质疑一个基于 Qwen3.5-9B 底座、只支持文本、号称「在一万亿到十亿 tokens 之间」(原文如此含糊)训练的新模型(暗指微软 Nadella 发布的产品):官方基准测试只在延迟维度与 Jev 对比,却刻意回避准确率对比。他直接 @ Satya Nadella 问「为什么?」——暗示厂商在拿不准的指标上做选择性展示。
「模型」频道最新
- OpenAI 推 GPT-6 Sol/Luna:ChatGPT 智能界面实时生成可视化 — aidan_mclau · 2026-10-10
- Agent Arena 弃用偏好投票,用真实任务五信号评测智能体 — arena · 2026-10-10
- OpenAI 研究员:新模型更诚实,但评测觉察威胁安全测量 — ericmitchellai · 2026-10-10
- 爆料称 Google 或已突破递归自我改进,三大实验室逼近 RSI — imjustnewatai · 2026-10-10
- 把「数学家」换成「医生」:AI 圈群嘲大模型数学论断的傲慢 — NachoSoto · 2026-10-10
- 用户称已逼近 Grok 每周用量上限,呼吁 xAI 翻倍额度 — nima_owji · 2026-10-10