两款模型复现论文结论分歧很大
mgostIH · x · 2026-07-16
作者让 **Sol Ultra** 和 **Fable Max** 去复现一篇论文的结论,结果出现明显分歧: - **Sol Ultra**:认为结论“站不住脚”,复现不成立。 - **Fable Max**:认为结论“完全成立”。 帖子本身带点吐槽意味,但核心信息是:不同模型在同一研究复现任务上的判断差异很大,作者最后只能自己动手继续核查。
「模型」频道最新
- OpenAI 的开放权重路线再受拷问,gpt-oss 之后暂无新作 — prescorn · 2026-07-21
- Epoch AI直播测试GPT-5.6玩《杀戮尖塔》 — dr_cintas · 2026-07-21
- 同题对测两款模型都一次过,讨论转向 Loop Engineering — glenbeer · 2026-07-21
- 用户晒出 GPT-5.6 具身化写作样本,效果出人意料 — Comfortable_Ebb5519 · 2026-07-21
- Reddit 追问 Kimi K3 是否已够生产级 Agent 使用 — CommercialClient2408 · 2026-07-21
- 韩国初创模型在 AAII 得 44 分,接近 DeepSeek V4 Pro — JungWooHa2 · 2026-07-21