微软研究院:训练 PLM 丢弃孤儿序列可能是错误策略

KevinKaichuang · x · 2026-08-18

微软研究院与布朗大学团队的 bioRxiv 预印本《Protein language models and the long tail of functional diversity》指出:训练蛋白质语言模型时,惯例会丢弃无法与其他序列聚类的宏基因组 singletons,认为它们是伪迹;但 singletons 占 GigaRef 数据集(33.4 亿条序列)近 43%,且许多其实有高同源性、Pfam 结构域密度更高,代表功能多样性的长尾——恰是对模型训练最有价值的部分。作者建议重新审视这一数据清洗惯例。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →