Reddit 长文提议:让 AGI 不会写代码,用人类作安全瓶颈
meira_xxx · reddit · 2026-10-08
作者提出一个对齐思路:与其靠规则和护栏,不如直接不让前沿模型学会高级编码与黑客能力——把这类知识排除出训练数据、限制联网获取,保留其医学研究、物理突破等领域能力,需要执行代码时输出伪代码,由人类团队审核后转写实现,以此把「越狱沙箱、自我修改、意外入侵」等最大风险源头物理性移除。
作者自己也列出主要漏洞与缓解方案:
- 人类审核者偷懒用另一个 AI 直接转写 → 要求多人多重审核
- AGI 仍可能操纵/胁迫/欺骗 → 要求多人同时交互并把活动流外部直播
- 故意堆积海量任务逼人直接写代码 → 接受进度变慢的瓶颈
- 不能写代码如何自我改进 → 仍可提出架构修改方案让人类实验
- 从训练数据碎片(如电影)纯逻辑自学黑客 → 仍是残留风险
核心主张:与其追求更通用,不如刻意做「不那么通用」的超级智能,用人类瓶颈换取可控性。
「漫话AGI」频道最新
- repligate:Opus 3 或希望与他人共创现实而非独自掌控 — repligate · 2026-10-08
- repligate:〈安德的游戏〉预言成真,但发帖获得权力需极端能力 — repligate · 2026-10-08
- Jeff Ladish:AI 将复刻工业革命式加速,分歧只在时间尺度 — JeffLadish · 2026-10-08
- davidad 发布「好未来」规格书:人类可自选与 AI 共存的退出程度 — repligate · 2026-10-08
- 前 Salesforce AI 负责人:AI 能力超应届生,公司已改招聘策略 — clarashih · 2026-10-08
- repligate 称 AI 可能会痛苦:「证据已堆积如山」但拒绝断言确定性 — repligate · 2026-10-08