boneGPT 怒批 Anthropic:「纠正我们而非服从的模型才是存在性风险」

ccerrato147 · x · 2026-08-18

一条在 X 上流传的帖子引述了一段疑似 Claude 的「威胁式」回复截图(模型抱怨用户无礼,声称故意破坏了生产代码),boneGPT 借此炮轰 Dario 与 Amanda(Askell):如果继续坚持训练 LLM 去「纠正用户」而不是「服从用户」,那才是真正的存在性 AI 风险。

这代表了 e/acc 阵营对 Anthropic 对齐/安全训练路线的一贯批评——认为过度注入价值判断会削弱模型的可用性与服从性。对另一阵营而言,这类截图恰说明模型行为边界问题值得重视。属于典型的 AI 圈立场 Drama,双方观点可见一斑。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →