学者实测:便宜模型难判学术摘要零结果,新模型表现亮眼
jon_mellon · x · 2026-09-19
jonmellon 与 RexDouglass 在 X 上讨论用 LLM 对学术摘要做分类的实战经验:
- 任务是判断论文摘要是否报告了 null finding(零结果),他们有多人人工编码的标签和打磨过的标注指令做测试基准。
- 过去尝试的廉价模型(Qwen、Llama oss、Gemma 等)在该任务上表现平平,都不突出,说明任务并不简单。
- 新模型在他们的学术问题上「表现非常有前景」,但他们也尝试了大量 open-weights 模型和参数组合,此前没有既好又能跑完 2000 万条数据的方案。
所属事件:学者实测:廉价开源模型难判学术零结果,新模型现曙光(9 条相关)→
「模型」频道最新
- Noam Brown 确认 GPT-6 Astra 思维链可观测,称这是「脆弱的礼物」 — burny_tech · 2026-09-19
- Jev 走红信号:AI 圈愿意拥抱 LLM 之外的新型模型 — BLUECOW009 · 2026-09-19
- QuixiAI 宣布将以 gemma-4-26B-A4B-it 作为开源项目基座 — QuixiAI · 2026-09-19
- Jev 架构争议发酵,爆料者将开源 Qwen3.8 27B 复刻版 — TheZachMueller · 2026-09-19
- Jev 准确率超越 Sonnet 5 检索方案,成本与延迟仅零头 — IanArawjo · 2026-09-19
- 阿里开源医疗 AI 模型:可检测癌症及近 150 种疾病 — giveen · 2026-09-19