合成数据溯源研究:改写后来源识别从 98.7% 骤降至 29%,且溯源无助于挑数据
Joss Armstrong · hf · 2026-10-07
- 研究检验「模型生成数据能否可靠溯源、溯源能否帮助挑更好的训练数据」两个问题。
- 在金融风险文本上:对原始生成段落的生成器归属准确率达 98.7%,改写后降至 53.1%,风格重写后仅 29.0%;生成 vs 人类文本检测对测试对比集仍接近完美。
- 三轮生成-重训实验比较两种选样规则:基于来源信息 vs 基于独立参考模型打分。两者选出不同样本,但计划比较未检测到模型退化的稳定差异。
- 结论:识别数据来源与识别数据有用性是两个独立问题,溯源分数与测试的代理指标都不足以预测递归训练行为。
「研究」频道最新
- 88B token小学课程训练:LittleLearner证明新能力是“诱发”而非“习得” — amplifiedamp · 2026-10-07
- AI 攻坚数学的旧路径:现象→猜想→新工具→解答,很快将不再主流 — _onionesque · 2026-10-07
- AI 挖矿数学富矿论:已有大量中间成果等待 AI 系统性开采 — _onionesque · 2026-10-07
- 机器人仿真器 RaiSim 回归:2.8.0 主打 CPU 高速仿真+照片级渲染 — ChongZzZhang · 2026-10-07
- DAEDALUS:无任务无验证器,靠自生成练习为 Agent 积累记忆 — illuin · 2026-10-07
- 冻结模型外部存数值记忆:Qwen 到 Mistral 复现,Top-1 命中 99.2% — Nearby_Indication474 · 2026-10-07