ProteinDPO 用偏好对齐解决蛋白模型对齐问题
bravo_abad · x · 2026-08-23
Talal Widatalla 等人提出 ProteinDPO,将 LLM 的直接偏好优化(DPO)应用于蛋白质语言模型,解决模型内部偏好与工程实际需求(如稳定性)不匹配的问题。
核心方法:
- 使用约 66 万条实验稳定性测量数据作为偏好数据。
- 模型通过对比更稳定与较不稳定的变体序列进行学习,而非仅对好样本微调,从而保留了预训练获得的大量通用知识。
结果:基于 ESM-IF1 微调后的模型,在偏好对齐方面表现提升。
「研究」频道最新
- Prompt Injection 损失极小?攻击成本降低或带来新风险 — joshua_saxe · 2026-08-23
- 硬核移植:将 Ninfer 移植至 CMP 170HX,Qwen 性能翻倍 — ubrtnk · 2026-08-23
- Claude 与 Codex 闯关 Cayley 666 难题:为何越来越难 — AndLukyane · 2026-08-23
- 研究:错误配置的 Admin 提示可击穿安全层 — Simple_Passion_7741 · 2026-08-23
- 7500 行代码教你从零训练现代语言模型 — tom_doerr · 2026-08-23
- 文章解析从形式语义到知识图谱与 Agent 的演进 — adnan_hashmi · 2026-08-23