研究揭示蛋白质设计模型存在分类偏好,训练数据影响生成特性
iskander · x · 2026-07-31
一项计算生物学研究系统性地刻画了蛋白质设计模型中的隐藏偏见,发现训练数据的性质从根本上决定了模型的系统偏好。
- 结构条件模型(如 ProteinMPNN)几乎不存在真正的分类学偏见:在控制可测量的生物物理性质(如紧凑性和稳定性)后,物种身份仅解释不到 3% 的评分方差,表明这些模型学习了通用的折叠原理。
- 相反,序列条件模型可能表现出更明显的偏好。
- 研究还指出,结构数据库中古菌蛋白的过度代表(因其更耐热、更易测定结构)足以显著影响模型生成的序列特性。
「研究」频道最新
- AI4Bharat 推 0.8B 参数 IndicOCR,覆盖 9 种以上印度文字 — prajdabre · 2026-08-26
- LAWA 方法:利用潜在动作实现高效世界模型预测 — Xiang Li · 2026-08-26
- FaSHIoNPOp 算法:球面上谱整形无序点快速生成 — ssh4net · 2026-08-26
- IROS 2026: 充气大白皮肤机器人实现全身触觉感知 — nptacek · 2026-08-26
- 开发者自建本地智能体 Secret Agent Bubbles:白天干活晚上自我强化 — cephaloform · 2026-08-26
- 为何数学家不愿帮 AI 验证证明? — voooooogel · 2026-08-26