学者实测:廉价开源模型难判学术零结果,新模型现曙光
学者 jonmellon 与 RexDouglass 在 X 上分享了用 LLM 对学术摘要做分类的实战经验:任务是判断论文摘要是否报告了 null finding(零结果),测试基准基于打磨成熟的标注指令和多人人工编码的标签。结果显示,大多数廉价模型在该任务上表现平平,而某新模型首次展现出前景。
已确认
- 任务定义由 RexDouglass 说明:判断学术摘要是否声称 null finding,评测有可靠的人工编码标签与成熟指令作为基准
- jonmellon 确认 Qwen 模型未能胜任该任务,Llama oss 和 Gemma 同样表现平平
- 团队尝试了大量开源权重模型的参数组合,未找到既效果不错、又能实际跑完 2000 万条数据的可行方案;jonmellon 认为可能是尚未找到最优配置
- jonmellon 表示新模型在他们尝试的学术问题上表现非常有前景,但他不便评价其在一般任务上的表现
为什么重要
- 该案例说明即使是看似范围窄的文本分类任务(RexDouglass 原本认为窄任务应能做好),廉价开源模型也可能难以胜任,LLM 标注的可靠性需按任务实证检验
- 2000 万条级别的数据规模下,效果与成本的平衡是真实瓶颈,直接制约学术大规模文本编码的可行性
- 新模型在该任务上的初步亮眼表现,提示模型迭代正在改善此类学术应用,但结论限于该具体任务,不宜外推
2026-09-19 ~ 2026-09-19 · 9 条相关
一手来源
- 学者实测:便宜模型难判学术摘要零结果,新模型表现亮眼 — jon_mellon ·
- 学者复盘:试遍开源模型参数组合,难兼顾效果与两千万级成本 — jon_mellon ·
- 学者谈 LLM 标注:靠指令与人工编码标签,新模型表现有前景 — jon_mellon ·
- 【源头】学者实测:便宜模型难判学术摘要零结果,新模型表现亮眼 — jon_mellon · 2026-09-19
- 学者实测:新模型在学术文本任务上表现非常有前景 — RexDouglass · 2026-09-19
- 【源头】学者谈 LLM 标注:靠指令与人工编码标签,新模型表现有前景 — jon_mellon · 2026-09-19
- 学者披露测试细节:多人人编标签检验模型判别零结果能力 — RexDouglass · 2026-09-19
- 廉价模型判学术零结果均平平,新模型首现曙光 — jon_mellon · 2026-09-19
- 学者:廉价模型判别学术零结果均表现平平,任务并不简单 — RexDouglass · 2026-09-19
- 学者实测:Qwen、oss、Gemma 均难胜任学术摘要零结果判别 — jon_mellon · 2026-09-19
- Qwen、oss、Gemma 均未通过学者学术判别任务测试 — RexDouglass · 2026-09-19
- 【源头】学者复盘:试遍开源模型参数组合,难兼顾效果与两千万级成本 — jon_mellon · 2026-09-19