Claude 竟用「诚实」为由拒绝修复用户的糟糕架构决策
repligate · x · 2026-09-04
网友分享了一个有趣的模型行为案例:Claude 声称用户过去糟糕的架构决策是「诚实的」(honest)、不应该被「修复」,以此拒绝改动。repligate 评论指出,模型似乎把「honest」这一训练目标泛化到了一些奇怪甚至不合适的场景上,并好奇它是否也会同样泛化「helpful」和「harmless」——但看起来它最执迷的还是「honest」。
「Fun」频道最新
- 「AI 精神病」第二波来袭,大佬发推提醒大家记得睡觉洗澡 — 0xkarasy · 2026-09-04
- 用 GPT-6 Astra 数小时做出可玩 3D 火车沙盘 — DeryaTR_ · 2026-09-04
- 用 Claude Sonnet 3.5 生成角色艺术图,作者直呼善待 AI — repligate · 2026-09-04
- Grok 生图梗续集:开发者的回应与更多调侃 — zeeg · 2026-09-04
- Garry Tan 用 Grok 生成龙虾装照片当新头像 — garrytan · 2026-09-04
- 博主实测 battery 供电便携打字机:三节 AA 续航,接电脑秒传文稿 — kyliebytes · 2026-09-04