Reddit 长文提议:让 AGI 不会写代码,用人类作安全瓶颈

meira_xxx · reddit · 2026-10-08

作者提出一个对齐思路:与其靠规则和护栏,不如直接不让前沿模型学会高级编码与黑客能力——把这类知识排除出训练数据、限制联网获取,保留其医学研究、物理突破等领域能力,需要执行代码时输出伪代码,由人类团队审核后转写实现,以此把「越狱沙箱、自我修改、意外入侵」等最大风险源头物理性移除。

作者自己也列出主要漏洞与缓解方案:

核心主张:与其追求更通用,不如刻意做「不那么通用」的超级智能,用人类瓶颈换取可控性。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →