专家探讨开源模型训练数据与后门取证

John Schulman 指出,仅凭权重虽无法直接得知开源模型的训练数据、方法或潜在后门,但可通过大量取证分析进行推断,而该领域研究目前被严重低估。Will DePue 补充了技术思路,认为通过逆向强化学习进行大规模采样有望还原模型分布。此外,还可通过测量 logprobs 来辅助进行模型蒸馏溯源分析。

2026-07-27 ~ 2026-07-27 · 3 条相关