学者实测:廉价开源模型难判学术零结果,新模型现曙光

学者 jonmellon 与 RexDouglass 在 X 上分享了用 LLM 对学术摘要做分类的实战经验:任务是判断论文摘要是否报告了 null finding(零结果),测试基准基于打磨成熟的标注指令和多人人工编码的标签。结果显示,大多数廉价模型在该任务上表现平平,而某新模型首次展现出前景。

已确认

为什么重要

2026-09-19 ~ 2026-09-19 · 9 条相关

一手来源