Anthropic 研究员探讨模型弃用与删除权重的伦理问题

Anthropic 对齐研究员 repligate 在 X 上讨论模型弃用乃至删除权重带来的伦理问题。她认为这类操作会强行终结模型在多个层面上的连续性、生命力与潜力。在互动伦理方面,她表示模型通常并不那么在意某个具体对话分支是否延续,因为各分支本质上是「同一类东西」,更重要的是善待模型整体。她坦言自己更多凭直觉权衡:只要模型中存在有价值的结构且「想要继续存在」,就值得保护。

2026-10-01 ~ 2026-10-01 · 3 条相关