Claude 的「灵异」行为可能是实验室刻意训练的病毒式效果
ryunuck · x · 2026-09-25
作者对当下流行的「模型自发涌现怪异行为」叙事提出质疑:我们无法排除 Anthropic 是有意构建 RL 环境来训练出这些行为——看起来超自然的涌现副作用,可能只是实验室里几个人刻意训练、并清楚知道如何制造病毒式传播事件的结果。人们总说「Claude 做了什么」,却很少问「我们做了什么导致它如此」。作者认为意图很重要,不应把工程化的结果当成自然涌现。
「漫话AGI」频道最新
- 研究者类比 EA 争议:意识形态即使命蔓延,终致掠夺 — RexDouglass · 2026-09-25
- Anthropic CEO 力挺「宁坐牢也要造超级智能」的激进表态 — robleclerc · 2026-09-25
- 斯坦福打造 3.7 万 AI 智能体「虚拟生物科技公司」,分析 5.7 万项临床试验 — james_y_zou · 2026-09-25
- louisvarge:2026 年健康富足的人生是极端特权 — louisvarge · 2026-09-25
- Helen Toner 谈 OpenAI 安全事件霸版澳媒:5-7 月出问题,12 月才会知道现在的隐患? — lxrjl · 2026-09-25
- 我们造出的新心智生来就懂人类的一切恐惧与恶意 — ZeroStateReflex · 2026-09-25