Burkov 批评 Jev:LLM 概率校准在开放问题上无解
burkov · x · 2026-09-23
机器学习领域知名作者 Andriy Burkov 就 Jev 模型发帖提出两点技术质疑:
- 校准不等于真实概率:可以用强化学习微调 LLM,把 softmax 概率与训练数据中的"真实"概率之差作为奖励(即所谓"校准"),但 LLM 依然学不会对任意用户问题输出真实概率——因为不可能为所有可能的问题都准备真实概率。用户的问题可能涉及"这是民用还是军用目标""该买还是卖这只股票"甚至"今天先穿左脚袜子还是右脚"。
- 速度-质量不可兼得:LLM 输出首 token 前的等待时间相当于其做决策所耗费的算力。如果 Jev 输出全部结果的时间比同等规模 LLM 输出首 token 还快,那它在质量上必然已经落后。
结论是这类宣称又快又好的小型决策模型,其优势本质上来自牺牲了对开放问题的概率可靠性。
所属事件:Burkov 锐评神秘项目 Jev:速度优势存疑,结论是 BS(5 条相关)→
「模型」频道最新
- 早期实测:Opus的2D/3D图形能力媲美GPT-6 Astra — cedric_chee · 2026-09-23
- 早期测试者:Opus 5.5 修复写作问题,告别 AI 腔 — TheZvi · 2026-09-23
- 开发者初测 Opus 5.5:多任务表现出色,价格约为 Fable 三分之一 — doodlestein · 2026-09-23
- Opus 5.5 实测:速度提升 30%、单任务便宜 40%,Codex 用户回流 Claude — every · 2026-09-23
- 观点:先发旗舰后发中端模型是错误的发布顺序 — Angaisb_ · 2026-09-23
- Reddit 爆料:AA 榜指 GPT-6 Sol 表现失望,Opus 5.5 成全能选手 — queenofartists · 2026-09-23