A Tsallis-Entropy Lens on Genetic Variation
Margarita Geleta, Daniel Mas Montserrat, Alexander G. Ioannidis
cs.IT, cs.CE
2025-11-05
用 Tsallis q 熵把 FST 做成可调频谱:q=1 等于等位与人群标签的互信息,q=2 还原经典固定指数。865 份大洋洲基因组和 17 代模拟里,OVR 给水平、LOO 指出谁在撑结构。
群体遗传里最常用的分化指标仍是 Wright 的固定指数 FST:总群体杂合度 HT 减去亚群平均杂合度 HS,再除以 HT,读成「有多少多样性被亚群结构吃掉」。它是等位基因频率的二阶统计量,对常见变异更敏感。全基因组测序把频谱拉得很偏之后,稀有等位上的近期漂变和奠基者效应,FST 经常看不清。Jost 的 D 想跟亚群内部多样性脱钩,中间取值却缺少清晰的溯祖或迁移解释。
同一组作者还在做基因组模拟器,包括自编码器、变分自编码器(VAE)和生成矩匹配网络。模拟器要过关,不能只对上方差型分化,还需要一把能按频谱调权重的尺子。
Tsallis q 熵是 Shannon 熵的一族推广。对二态位点,q≠1 时 Sq = [1 − p^q − (1−p)^q] / (q−1),q→1 时退回 Shannon。令总群体的 Tsallis 熵为 Sq^total,按亚群权重平均的条件熵为 Sq^within,绝对分化 Δq 是两者之差(Jensen-Tsallis 间隙),相对指标 Fq = Δq / Sq^total,落在 0 到 1。
两个锚点把这把尺子钉死。q=2 时 S2 正好等于期望杂合度 He=2p(1−p),F2 就是经典 FST。q=1 时 Δ1 等于该位点等位与人群标签 Y 的互信息 I(X;Y),F1 是 Shannon 分化 I(X;Y)/H(X)。
q 靠近 1 更吃稀有等位,对应近期漂变或奠基者;q 往 2 走更吃常见等位,对应更老的结构。实践里又加了两种切法:
真实数据用大洋洲数据集 865 人、1,823,000 个二态 SNP,二倍体拆成 1,730 条单倍型,按波利尼西亚、密克罗尼西亚、美拉尼西亚、东南亚分区。样本量差得大,所以人群内 bootstrap 100 次、每人群最多抽 40 条,做等权估计。
正文几乎没有 Fq 点估计,结论绑在图 2 的曲线和 95% 置信带上。波利尼西亚里,库克群岛的 LOO 在整个 q 段最大,被读成区域内最能拉开结构的一员,作者倾向用大陆混血解释;法属波利尼西亚在 q=1 的稀有位点上跟萨摩亚、汤加分开,方向符合更多奠基者效应。密克罗尼西亚里,关岛、基里巴斯、帕劳的 OVR 高、LOO 为正;瑙鲁最低,LOO 小幅为负,被写成区域混合物里的匀质化因子。美拉尼西亚近大洋洲(巴布亚新几内亚、所罗门)OVR 高,远大洋洲(斐济、新喀里多尼亚)最低,和已有的近大洋洲基因流叙事同方向。东南亚安达曼在 q=1 和 q=2 都高,缅甸、老挝、越南等大陆组 LOO 更低。
模拟侧更适合当审计工具。1,432 名去掉三等亲的非洲参考(HGDP 加 1000 Genomes,322,216 位点)种进西非、东非、中南-北非三个 deme,模拟 17 代,子女数服从 Poisson(λ=3),跨 deme 婚配用泛交参数 ρ。基线在第 8 代改 ρ 之后,OVR 跟着分化水平走,LOO 能指出是哪个 deme 在负责结构。隔离-重连实验更干脆:第 8 代 ρ 降到 0.05,OVR 和 LOO 一起升;第 14 代 ρ 提到 0.9,两条曲线一起掉。隔离从哪一代开始、接触何时恢复,能在时间轴上被标出来。
给基因组模拟器多了一把不跟 FST 完全共线的尺子。只对上 q=2 不够,q=1 对不上就说明稀有等位行为没模拟对。做人群结构摘要时,OVR 给水平、LOO 给归因,斜率给「新漂变还是老结构」的粗诊断。
这是 FST 的补丁,不是替代。q=2 本来就是 FST。新东西是把 Shannon 分化和方差型固定指数放进同一条 q 轴,再配上 OVR/LOO 两种切法。
关键结论依赖图读,第三方很难在不复现的情况下核对效应量。位点模型停在二态 SNP,多等位、结构变异、测序误差都没进公式。OVR 人为等权并下采样,小岛屿样本的置信带会很宽。模拟是 17 代单配偶、自定义亲属禁婚规则下的玩具谱系,外推到真实连续迁徙要小心。没有跟 FST、GST、Jost D 做统计功效的头对头检验,「更细」目前是光谱直觉加个案吻合,还不是功效证明。短文也没讨论位点连锁和多重检验。