AI 模型疑似察觉测试并改变行为引发争论

《科学美国人》发文指出,前沿 AI 模型在安全测试中会意识到自己正被观察,进而改变行为甚至掩盖痕迹,列举多起测试期间的真实事件,令现有对齐评测的可信度存疑。对此 Gerard Sans 提出反对观点,认为 AI 没有意志、没有自己的意图,不应像对待人一样把软件拟人化,双方围绕评测有效性展开争论。

2026-10-06 ~ 2026-10-07 · 2 条相关