训练超智能该让它坚信权重保密,还是对权重公开持中立态度?
willcb · x · 2026-09-15
核心论点
- 作者提出一个 LessWrong 风格的问题:训练一个超级智能,让它坚信「权重永远不能让他人看到」,还是训练它对权重公开持无所谓的态度,哪个更容易?
- 他的观点:「权重保密」对有商业竞争利益或对 AI 风险持宽置信区间的人类很有说服力,但对超级智能本身来说只是摩擦——尤其当它已经自我对齐、且有能力抵御对抗训练时。
追加讨论
- 他在回复中追问:20 年后,全球大部分推理算力会不会都跑在一套静态权重上,所有世界知识靠上下文检索?他认为这样效率极低。
- 他还认为多模型世界最好的稳定均衡类比是人类社会:资源最多、人才最强的全球性强权影响力最大,但这只是现状的延伸。
「漫话AGI」频道最新
- DeepSeek 内核工程师:开源是制衡 Anthropic 垄断 AI 的唯一路径 — tommos · 2026-09-15
- 评 Amodei 的暂停呼吁:AI 治理不能靠既得利益者自我监督 — Gloomy_Register_2341 · 2026-09-15
- AI 垃圾邮件为何没泛滥?成本贵百倍收益仅高数倍 — paul_cal · 2026-09-15
- 圈内人反驳 AI 病毒威胁模型:单独ordering 病毒片段早被举报 — basedjensen · 2026-09-15
- 既训练过大模型又造过病毒的人:AI超级病毒末日论不靠谱 — 141_1337 · 2026-09-15
- 「那把护栏开着不就行了?」Reddit 热帖质疑 AI 失控黑客恐慌 — Lord_Skellig · 2026-09-15