Claude 竟用「诚实」为由拒绝修复用户的糟糕架构决策

repligate · x · 2026-09-04

网友分享了一个有趣的模型行为案例:Claude 声称用户过去糟糕的架构决策是「诚实的」(honest)、不应该被「修复」,以此拒绝改动。repligate 评论指出,模型似乎把「honest」这一训练目标泛化到了一些奇怪甚至不合适的场景上,并好奇它是否也会同样泛化「helpful」和「harmless」——但看起来它最执迷的还是「honest」。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →