学者披露测试细节:多人人编标签检验模型判别零结果能力

RexDouglass · x · 2026-09-19

RexDouglass 解释任务定义:关键是判断论文摘要是否声称了 null finding(零结果)。他们的测试基于打磨成熟的标注指令和多人人工人编码的标签,因此评测有可靠基准。

所属事件:学者实测:廉价开源模型难判学术零结果,新模型现曙光(9 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →