事实性评测需要重构,相关论文获 COLM workshop 最佳论文奖
caglarml · x · 2026-10-10
Anja Surina 等人的研究指出,当前对语言模型「事实性」的评测方式存在根本问题,需要重新设计。该论文获得 COLM 会议「基础模型科学理解」 workshop 的最佳论文奖,作者包括 @imtd 和 @caglarml,论文链接见原帖。
论文核心主张是现有 factuality evals 的评估框架需要 rethink,对关注模型评测方法的研究者值得细读。
「研究」频道最新
- 用向量数据库替换权重矩阵,提出检索中心深度学习 — RobertTLange · 2026-10-10
- 上交大 UVTA 用 1000 条人类触觉示范教会机器人灵巧操作 — siyuanhuang95 · 2026-10-10
- 20 分钟讲透特斯拉 FSD:8 摄像头 36 帧,20 亿信息炼成两个输出 — PTrubey · 2026-10-10
- 21位学者联署白皮书:视觉通用智能能否通向AGI — HirokatuKataoka · 2026-10-10
- Epoch AI:三个数学子领域超半数 arXiv 论文已承认使用 AI — burny_tech · 2026-10-10
- 学者批评 Transformer 教学图示:自注意力总被画成黑盒方块 — PlisSergey · 2026-10-10