圣训计算进了 LLM 时代,叙事综述说卡点仍是证据基建

Hadith computational science in the age of large language models: a critical narrative review

Md. Ashraful Haque, Riasat Islam

Greentech Apps Foundation, United Kingdom / Queen Mary University of London, London, United Kingdom

cs.CL, cs.AI

2026-06-18

对 32 项代表研究的叙事综述认为,切分已经比较成熟,传述者消歧和跨库迁移仍弱,LLM 改变了规模和工作流,领域该按可追溯证据而非单点分数来评估。

这篇在解决什么

圣训计算研究从规则系统和小语料走过来。Azmi 等人 2019 年的综述画过早期地图:切分、传述者抽取、本体、检索、辅助鉴真。Transformer 和 LLM 进来之后发表量涨了,最近几篇综述多半在数论文、贴方法标签。缺的是另一类问题:哪些结果扛得住、哪些只在某个基准上成立、哪些硬伤还挡着学者真用。

作者做的是批判性叙事综述,不是 PRISMA 式计量。材料来自 2025 末到 2026 初在 Google Scholar、Scopus、ACL Anthology、SpringerLink、ScienceDirect、arXiv 等库的检索,初筛 42 条,收窄到 32 条。评价维度写死:语料是否只盯六大部经、有没有跨库迁移、能不能复现、有没有领域专家、任务是不是学术工作流的代理指标。

方法

没有新模型。审查框架把圣训计算管线分成三层。Level 1 是 isnad-matn 切分,把传述链和正文剥开。Level 2 是传述者消歧、来源核验、问答、鉴真相关建模。Level 3 是知识图谱、语料级富化和研究基础设施。

代表性工作按六维打表,而不是灌一个总分。Altammami 等在六大部经上做端到端切分,有跨书测试,但仍困在正统文本。Muther 和 Smith 把长文本里边界歧义写进标注。Mahmoud 等把传述者消歧做成可训练任务,人造 sanad 上好看、真实测试掉一截。Mghari 等的 Sanadset 有 65 万条传述、926 部书,多样性上来了,本身不是迁移解。Mubarak 等把忠实性和幻觉做成可测的古兰经与圣训问答任务。Asgari-Bidhendi 等用 LLM 管线富化 120 万条传述、六位领域专家打分,规模是基础设施级的,可复现性被标成否。

结果

作者的判断是进展不均匀,旧方法也没有被 LLM 整体换掉。规则和混合系统在稳定切分上仍有竞争力;Transformer 抬了切分和检索的上限;知识图谱和检索接地把字段推向可检查的证据结构;LLM 让语料级富化、多语言入口和 grounded 评测变得可行。Level 1 成熟最快,因为任务定义清楚、标注可复用。Level 2 变宽了,没有收敛。Level 3 从本地建图走到管线级富化。

四类结构性缺口写得很硬。基准文化仍过度集中在逊尼派六大部经,这些文本编辑干净、结构规整,容易做出好看分数,也容易高估可迁移性。注释层 sharh、takhrij 推理、fiqh al-hadith 几乎还没被当成计算对象。圣训和古兰经、圣传 seerah、传记文献的跨源连接多为成对、任务特定,缺可检查的多跳证据图。通向当代教法的桥梁被说成证据支持,系统不该自动发法特瓦。

LLM 实际改了三件事。规模上,Rezwan 一类系统让处理数十万到百万级传述变得可想象。工作流上,OCR 修复、切分、检索、核验、简化、语义标注、人工校验被串起来。证据标准上,干净语料上的高分不再够用。没改的是传述者身份解析、预处理脆弱,以及流畅生成和可靠学术之间的差别。

为什么重要

给做圣训与经注文本、低资源古典语言、高风险领域 NLP 的人一套更苛刻的读论文方式。任务成熟度和发表量不是一回事。人造链路上的分类准确率不能直接翻译成真实传述者消歧。专家打分的大管线和经典切分 F1 也不可比。作者把领域成功标准改写成证据基础设施:来源可追溯、专家在环、不确定性和出处是系统质量的一部分。

对产品侧的含义同样具体。伊斯兰问答和法特瓦生成已经在往前走,但一条只返回单条圣训、不带出处、异文和注释框架的系统,还算不上严肃的教法辅助。该用在语料富化、检索接地、辅助切分,不该用在无人监督的鉴真或自动裁决。

局限与存疑

叙事综述自带检索和选择偏差,作者也写了:主流数据库索引的研究被偏爱,阿拉伯语弱索引刊物和灰色文献会被低估。32 条精炼清单撑不起领域全貌的统计结论,「六大部经过度集中」「注释层缺失」是对代表样本的推断。学者视角文献多为概念性和小专家池,作者明确反对把任何一篇当成伊斯兰学者的总体代言。

没有新实验,也就没有可复现的数字来验证那张评价表。预印本只要贡献了正在被讨论的基础设施就会被保留,这会把尚未同行评审的主张带进主叙事。规范性议程写得很清楚,专家治理和教法证据支持仍停留在倡议,共享基准和数据开放路径还没有落地协议。

术语

原文与代码

相关论文

全部论文解读