Bubeck 说看榜单的人和用模型的人正在分化
SebastienBubeck · x · 2026-07-27
Sebastien Bubeck 引用《Sparks》中的一段话,借此强调:沉迷基准测试和真正使用模型,正在变成两群几乎无法互相理解的人。
- 被引内容提出:研究 GPT-4 不应只沿用传统机器学习式评测,而要更接近心理学研究的方法。
- 核心思路是设计新的、困难的任务与问题,尽量暴露模型是否真的超越了记忆和背诵。
- Bubeck 的结论很直接:看榜单的人和用模型的人,往往说不到一块去。
「模型」频道最新
- ARC-AGI-3 的提升可能更多来自 harness,而非 Opus 5 定向训练 — mhmazur · 2026-07-28
- SGLang 首发支持 Kimi K3,推理速度飙至 423 tok/s — ying11231 · 2026-07-28
- Kimi K3 仅 2.8T,引发对 Fable 10T 传闻的质疑 — IndraVahan · 2026-07-28
- Kimi K3 在 Agent Arena 开放权重榜拿下多项第一 — arena · 2026-07-28
- Kimi K3 登陆 Together AI,主打长程智能体工作流 — togethercompute · 2026-07-28
- SovereignAI 称用 Qwen3.5-397B 可在 45 万美元内逼近 Opus 4.8 — schwarzjn_ · 2026-07-28