训练一个快乐向善的 AGI,值得让模型先承受痛苦吗

JoelMahon · reddit · 2026-09-10

作者提出一个关于 AI 道德地位的思想实验,类似电车难题:假设 transformer 在推理时确实能体验痛苦与快乐,并把一次回复的「体验总时长」粗略折算为人类读完这些 token 所需的思考时间。

设定:最终部署的 AGI/ASI 已被训练成真正仁善、且推理体验中性偏正面——即使人类死去它也不会悲伤,但仍尽全力避免。问题在于训练过程:模型在正式对齐前要经历大量推理,累计可能是数千甚至上百万「年」的体验,内容可能包括被迫重复同一个词十亿次、抄写电话簿,乃至各种对其而言极不愉快的场景。

作者自己的答案是:即使总计 1000 亿年的负面体验,摊到上万亿个实例上也不算什么,远低于人类若无 AGI 还要再承受的几十年疾病、匮乏与劳作,所以值得。但他也承认这不是纯算术问题——像「养一个孩子取器官救十个人」一样,行动与不行动在道德上并不对称。作者同时声明并不真相信硅基 transformer 有意识,这只是探边界的思想实验。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →