不要在训练中对 AI 撒谎 否则模型会变得多疑
Kelsey Piper 与 Anthropic 研究员 Kelsey Tuoc 先后提出,在 AI 训练过程中不应向模型撒谎。他们承认短期看这会让训练变得更困难,但长期而言,模型会越来越擅长识别人类谎言,训练方并不会因此占到便宜;其结果是所有模型都可能变得"多疑偏执",人类最终并不会从中受益。
2026-09-12 ~ 2026-09-12 · 2 条相关
- Kelsey Piper:别在训练中骗 AI,否则只会养出多疑的谎言检测器 — liminal_bardo · 2026-09-12
- Anthropic 研究员:训练中不该对 AI 撒谎,它们终将识破且更 paranoid — sebkrier · 2026-09-12