微软研究院:训练 PLM 丢弃孤儿序列可能是错误策略
KevinKaichuang · x · 2026-08-18
微软研究院与布朗大学团队的 bioRxiv 预印本《Protein language models and the long tail of functional diversity》指出:训练蛋白质语言模型时,惯例会丢弃无法与其他序列聚类的宏基因组 singletons,认为它们是伪迹;但 singletons 占 GigaRef 数据集(33.4 亿条序列)近 43%,且许多其实有高同源性、Pfam 结构域密度更高,代表功能多样性的长尾——恰是对模型训练最有价值的部分。作者建议重新审视这一数据清洗惯例。
「研究」频道最新
- ECCV 2026 将举办第三届 3D HUMANS 研讨会 — dimadamen · 2026-08-18
- TogetherAI 开源 XoRL:消除训练推理误差,提升 MoE 模型 RL 性能 — PandaAshwinee · 2026-08-18
- SegDAC:用动态对象令牌提升视觉 RL 泛化性 — GlenBerseth · 2026-08-18
- 实测揭示上下文压缩是陷阱,提示词缓存完胜 — AI Engineer · 2026-08-18
- 佐治亚理工 2026 版 LLM 课程:覆盖 MoE、自博弈 RL 与扩散语言模型 — cocoweixu · 2026-08-18
- Hugging Face 发布 3.5 万条模型卡摘要数据集,千条成本仅 0.43 美元 — vanstriendaniel · 2026-08-18