giffmana:现役模型精度很强,召回能力却严重不足
giffmana · x · 2026-10-02
Google 研究员 Andreas Steiner(giffmana)回应 Ofir Press:与其说基准饱和,不如把这类基准理解为在测「召回」——据他一手体验,当前一代模型在 precision 上表现很好,但在 recall 上确实很差。
所属事件:普林斯顿研究员谈好基准三条件与基准饱和之争(3 条相关)→
「模型」频道最新
- 每月 400 美元买哪个 Agent?网友提议让它们同城对抗实测 — nick_linck · 2026-10-02
- fastino 发布 GLiDE:首个按需思考的决策模型,Decision Index 登顶 — kalyan_kpl · 2026-10-02
- Anthropic 自述:从 Sonnet 5 的「难聊」到 Fable 5.1 找回经典 Claude 手感 — every · 2026-10-02
- 1565 封邮件实测:Perplexity 与 Cloudflare 决策模型比拼 — michellechen · 2026-10-02
- 两张 96GB 昇腾卡本地跑 Qwen:从 1 tok/s 调到 30 tok/s 全记录 — matteiuspi · 2026-10-02
- ChatGPT 暴力内容审查过严,虚构故事也频繁触发改写 — CrispyIsHere · 2026-10-02