学者实测:Qwen、oss、Gemma 均难胜任学术摘要零结果判别
jon_mellon · x · 2026-09-19
jonmellon 回应 RexDouglass 的追问,确认 Qwen 模型同样未能胜任其学术文本判别任务,Llama oss 和 Gemma 也一样。结合上下文,该任务为判断学术摘要是否为 null finding,作者团队此前测试的廉价模型均表现平平,新模型才首次显得有前景。
所属事件:学者实测判别学术零结果:廉价开源模型集体失灵(3 条相关)→
「模型」频道最新
- 神秘模型 Jev 发布:宣称快 200 倍便宜 400 倍,网友实测叫好 — multiply_matrix · 2026-09-19
- GLM/DeepSeek/Qwen 开源小模型横评:质量看 GLM,速度选 Qwen — HankYeomans · 2026-09-19
- Ternary Bonsai 2 27B 压到 7GB 单文件,8GB 显存可跑 — cephaloform · 2026-09-19
- 研究者反驳Jev定位:语言本质是System 2,拿它做System 1说不通 — emax · 2026-09-19
- 闭源模型怎么被蒸馏?Reddit 热议 Anthropic 指控背后的技术机制 — LaughLegit7275 · 2026-09-19
- OpenAI 员工回应语音语言争议:英文音色也适用于多语言 — juberti · 2026-09-19