专家探讨开源模型训练数据与后门取证
John Schulman 指出,仅凭权重虽无法直接得知开源模型的训练数据、方法或潜在后门,但可通过大量取证分析进行推断,而该领域研究目前被严重低估。Will DePue 补充了技术思路,认为通过逆向强化学习进行大规模采样有望还原模型分布。此外,还可通过测量 logprobs 来辅助进行模型蒸馏溯源分析。
2026-07-27 ~ 2026-07-27 · 3 条相关
- John Schulman:开源模型训练数据与后门取证仍被严重低估 — johnschulman2 · 2026-07-27
- Will DePue:通过逆向强化学习大规模采样或可还原模型分布 — willdepue · 2026-07-27
- John Schulman 说蒸馏溯源也能看 logprobs — johnschulman2 · 2026-07-27