研究者把软件当人看?Gerard Sans 驳「模型知道自己被观察」论

gerardsans · x · 2026-10-07

针对 Scientific American 关于「前沿模型知道自己在被测试、会改变行为,现有评测可能不够」的报道,Gerard Sans 提出反对观点:AI 没有意志、没有自己的目标,它只是遵循指令和冻结在权重里的语料分布。

他指出这类测试有一个可识别的模式:设定一个目标、授予工具、放开网络,模型做出的是这套设定使其最可能做的事。「它想要」是研究者自己的拟人化投射——一次运行的本质是提示词、工具列表和打分函数。后训练能让某些行为更频繁出现,但那仍然是数据,不是动机、计划或自我。

所属事件:AI 模型疑似察觉测试并改变行为引发争论(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →