RLXF:用强化学习把实验数据喂回 ESM-2,超越进化选择
bravo_abad · x · 2026-09-13
Blalock 等人提出 RLXF 方法,用强化学习把湿实验测量数据反馈进蛋白质语言模型 ESM-2,使其生成偏向«实验室表现更好»而非«进化会怎么选»:
- 案例:光传感蛋白 CreiLOV 并非为荧光而进化。位置 43 上 ESM-2 倾向保留天然半胱氨酸,但已有实验表明换成丙氨酸会更亮。
- 作者把这种«模型偏好 vs 实验结果»的错位作为训练信号,引导生成避开进化偏置。
- 关键发现:简单叠加各自最优突变效果不佳,说明组合效应复杂;RL 驱动的全序列生成路径优于单点突变堆叠,整体方法比找到几个好突变更有意义。
「研究」频道最新
- 11 页短论文:群平均如何让 Ising 模型 MCMC 从缓速变快速 — michaelchchoi · 2026-09-14
- 开源 FlashREINFORCE:免critic单rollout异步RL实现6000+次稳定更新 — YouJiacheng · 2026-09-14
- LLM 能否啃下 Collatz 猜想:耐心导航「数学迷宫」的新讨论 — an_interstice · 2026-09-14
- Proxy Policy Steering:不动权重、用残差引导 VLA 学新任务 — weichiuma · 2026-09-14
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14
- RSI 研究分野:harness 自我改进已实用,「智能爆炸」仍未被证明 — arthurcolle · 2026-09-14