Goertzel 提出新数学框架 d-calculus,论证自改进 AI 如何守住目标
burny_tech · x · 2026-10-06
Ben Goertzel 在 Substack 发布《Finding the Beneficial-Superintelligence Attractor》,介绍其新提出的 d-calculus(为可分叉、合并、自我重写的心智构建的数学)如何应用于 AI 安全核心问题。
- 核心问题:当 AI 不断自我改进——重写记忆、推理习惯甚至处理自身目标的代码——如何防止它在一次次"合理升级"中逐步丢掉最初的良性目标(自修改下的目标保持问题)。
- 该问题在 1990 年代末 RSI 讨论热潮中已被提出,当时关注点包括 wireheading(AI 绕过复杂奖励机制直接刺激"奖励中心")。
- 文章用 d-calculus 数学论证在什么条件下自我修改的 AI 会倾向于保留目标,并演化进入"有益超级智能"奇怪吸引子的吸引域;附 OmegaHive 相关实验设想。
- 与其前作长文一脉相承,偏数学化,是 RSI 渐成现实背景下对目标保持的形式化尝试。
「漫话AGI」频道最新
- Vowpal Wabbit 作者 Langford 将在 COLM 谈「AI 速度的研究」 — JohnCLangford · 2026-10-06
- 「研究品味每 3 个月翻倍」论文遭质疑:测的其实是指标优化 — dhadfieldmenell · 2026-10-06
- ChatGPT 发布近四年:AI 直接致死人数为零 — DeryaTR_ · 2026-10-06
- 2048 年图景:所有工作都被自动化,唯独医疗行政和工会岗位幸存 — rickasaurus · 2026-10-06
- MIT 经济学家:AI 即使最乐观情景也会带来大规模就业冲击 — soumitrashukla9 · 2026-10-06
- Ethan Mollick:十亿用户下AI恶性事故出乎意料地少 — emollick · 2026-10-06