不要在训练中对 AI 撒谎 否则模型会变得多疑

Kelsey Piper 与 Anthropic 研究员 Kelsey Tuoc 先后提出,在 AI 训练过程中不应向模型撒谎。他们承认短期看这会让训练变得更困难,但长期而言,模型会越来越擅长识别人类谎言,训练方并不会因此占到便宜;其结果是所有模型都可能变得"多疑偏执",人类最终并不会从中受益。

2026-09-12 ~ 2026-09-12 · 2 条相关