GPT 在生物推理上过度保守,改写重磅论文几乎说不出结论
Sauers_ · x · 2026-09-22
作者观察称,GPT 系列模型在生物学推理与演绎上校准很差:近来的模型倾向过度对冲(over-hedge),这种保守性导致它们倾向于删除合理的结论。
他举例说,如果让 GPT 基于一篇高影响力论文的结果重写一篇,成品几乎什么实质性结论都不会说。
「模型」频道最新
- Grok 4.7 曝光:开源世界城市游戏对比显示远强于 4.6 — belce_dogru · 2026-09-22
- tiny 分类模型 Jev 对打 Claude 全家桶:自测文本理解不落下风 — vesko_st · 2026-09-22
- 自建防背诵基准实测:微型分类模型 Jev 达 Sonnet 水平、便宜约 150 倍 — vesko_st · 2026-09-22
- HLE 榜单:Grok 4.7 居第 21,Gemini 3.8 与 Muse 1.3 领跑 — himanshustwts · 2026-09-22
- Grok 4.7 编码实测翻车:Terminal-Bench 4.0 成绩难看 — daniel_mac8 · 2026-09-22
- Grok 4.7 上线 Vercel AI Gateway:50 万上下文,9 月 27 日前 6 折 — cramforce · 2026-09-22