学习式潜在蛋白质语言可将序列生成困惑度降 34%,长蛋白建模快 AlphaFold2 约 1000 倍
Mahdi Pourmirzaei · hf · 2026-10-07
新研究提出两种学习式「潜在蛋白质语言」,改进自回归 transformer 的蛋白质序列与结构生成。
方法:
- PLL(Protein Latent Language):基于冻结 ESM-2 编码器,把序列映射为每残基一个 token 的 4096 态上下文字母表
- SLL(Structure Latent Language):改造 GCP-VQVAE Lite,加入序列与置信度监督,仍可解码回骨架坐标
- 分别用下一 token 预测预训练得 PLLM 与 SLLM
结果:
- PLLM 拟合的计算 scaling 指数 0.038,对比氨基酸模型 0.020
- 无条件生成中,低熵样本比例相对氨基酸模型降低 54%
- 序列到结构预测中,换用 SLL 使最佳验证困惑度降 34%
- 长蛋白上潜在 token 采样比 MSA 版 AlphaFold2 快约 1000 倍
- SLLM 内部 token 置信度用于推理时采样,或可进一步提升结构预测质量
结论:学习式潜在语言是自回归蛋白质生成的可扩展基底。
「研究」频道最新
- LLM2Vec-Gen:冻结 LLM 单次前向生成答案嵌入,登上 COLM 2026 — sivareddyg · 2026-10-07
- 研究揭示混合架构 LLM 几乎只用注意力,辅助训练可逼出循环记忆价值 — mohitban47 · 2026-10-07
- 研究者提出 World Editing:不生成新世界而是编辑已有世界 — yuntiandeng · 2026-10-07
- 新研究追问:Agent 替你行动时,它到底站在谁那边 — ZacharyHuang12 · 2026-10-07
- RL 研究年度 Top 10 榜单出炉,Spurious Rewards 居首 — ShayneRedford · 2026-10-07
- SciConBench 团队:每两月跑一轮评测,寻找资金维持公开榜单 — manoelribeiro · 2026-10-07