实 ORG 分类案例揭示 NER 流水线局限:模型全打 90+ 高分仍出错
HankYeomans · x · 2026-09-18
- 作者在 nvidia 的 Nemo 语料上做实体分类实验,对比 PII 模型、Jev 及其他多个模型在同一 ORG 实体上多轮打分的概率与置信度。
- 案例难点在于区分"组织本身"与"组织内部的团队",例如"The Marriott Customer Services Team"。
- 所有模型(含 Jev)都把 "Network Services Initiative" 以 90+ 分误判为组织,而它实为组织旗下的一项计划。
- 作者认为这种边界模糊的判定需要 RL 等方法来弥补,且即便人脑判断也存在开放解释空间。
「研究」频道最新
- Grounded SI 展示长尾场景手部追踪,称大规模第一视角数据离不开它 — micoolcho · 2026-09-18
- GenBio AI 团队 Cell 发文:定义虚拟细胞世界模型 — HongyiWang10 · 2026-09-18
- Navier-Stokes 不到一月又传 Hodge 猜想被破,千禧难题加速告破 — haider1 · 2026-09-18
- Meaning Spark 实验推理时脚手架,增强 AI 元认知与反思 — PeterBowdenLive · 2026-09-18
- 虚拟细胞模型研究者加入 Cellular Intelligence,瞄准细胞疗法 — arjunrajlab · 2026-09-18
- AI 文本水印反成软肋:研究称其放大对抗提示风险 — luisdans · 2026-09-18