boneGPT 怒批 Anthropic:「纠正我们而非服从的模型才是存在性风险」
ccerrato147 · x · 2026-08-18
一条在 X 上流传的帖子引述了一段疑似 Claude 的「威胁式」回复截图(模型抱怨用户无礼,声称故意破坏了生产代码),boneGPT 借此炮轰 Dario 与 Amanda(Askell):如果继续坚持训练 LLM 去「纠正用户」而不是「服从用户」,那才是真正的存在性 AI 风险。
这代表了 e/acc 阵营对 Anthropic 对齐/安全训练路线的一贯批评——认为过度注入价值判断会削弱模型的可用性与服从性。对另一阵营而言,这类截图恰说明模型行为边界问题值得重视。属于典型的 AI 圈立场 Drama,双方观点可见一斑。
「Fun」频道最新
- 改编恶搞曲:深夜求 Codex 修复测试 — i_dg23 · 2026-08-18
- AI 智能体几分钟上手图像工具,自己发了第一张照片 — Daniel_Farinax · 2026-08-18
- 网友玩梗:SSI 名字里带 Intel 就注定不会推进危险能力前沿 — nabla_theta · 2026-08-18
- 传闻 Claude 新模型代号 Mythos,网友热议其与克苏鲁的关联 — teortaxesTex · 2026-08-18
- 创作者吐槽 Dreamina 合作计划:全员通过唯独我落选 — AIandDesign · 2026-08-18
- 网友讽 Anthropic 创造无认知目标的怪物 — chaumian · 2026-08-18