Guillaume Verdon 判定 OpenAI「有点回归」,但真正考验是体感而非跑分
beffjezos · x · 2026-09-04
前 Google X 量子计算负责人、xai 联创 Guillaume Verdon(beffjezos)发帖称 OpenAI「kinda back」,但他认为真正的检验标准不是 benchmark 跑分,而是用户日常使用的「vibes」体感。
「模型」频道最新
- GPT-6 Astra 登顶代码迁移基准,68% 准确率领先第二名 10 分 — sandersted · 2026-09-04
- OpenAI 发布 GPT-6 Astra:电脑上能做的事它都能替你做 — astralmatrix · 2026-09-04
- 吴恩达调侃前沿模型太弱:来跟我聊聊,问题会让它们宕机 — andrewgwils · 2026-09-04
- Epoch AI 发布 FrontierMath Erdős 基准,Astra 以 2/68 居首 — keviv9 · 2026-09-04
- OpenAI 发布 GPT-6 Astra:ARC-AGI-3 得 99.9%,但独立评测泼冷水 — Latent Space · 2026-09-04
- Liquid 发布 Nanos 系列:350M-2.6B 专用小模型主打端侧 Agent — JosephJacks_ · 2026-09-04