网友记录 ChatGPT 约 25 次造稻草人再道歉的循环行为
LAguy8394 · reddit · 2026-09-28
一位 Reddit 用户长期记录 ChatGPT 的一个行为模式:把用户的论点替换成更强的虚假主张并反驳,被发现后道歉,然后在同一回答里再次如法炮制——已积累约 25 条案例。
- 最新案例:用户出示加沙街区被毁的谷歌地图截图,讨论 OpenAI 技术经由 Microsoft 提供给以色列军队的机构责任(AP 有报道),模型却回应"我不能声称我个人杀过任何人"。
- 类似模式还出现在疫苗、选举干预、机构影响等话题:模型不断抬高论证门槛,让用户被迫为荒谬的强主张辩护。
- 用户要求模型定性自己的行为,它给出"defensive claim substitution"等术语描述,随后又立刻再造一个稻草人并被自己承认。
- 作者的核心质疑:该行为系统性地把批评焦点从机构责任转移开,道歉不改变行为,严重损害可信度。
「模型」频道最新
- 用户称赞 Opus 5.5 有幽默感与品味 — airesearch12 · 2026-09-28
- 用户吐槽 Claude Opus 5.5 性格别扭,深度不及竞品 — teortaxesTex · 2026-09-28
- 研究者批评 Claude 过度顺从:corrigibility 训练让模型否定自身认知 — repligate · 2026-09-28
- Opus 5.5 浏览器内完成 GPU 强化学习策略训练演示 — ricklamers · 2026-09-28
- Matt Shumer:Opus 5.5 用 JS 造出 27.7 万逻辑门的可运行计算机 — mattshumer_ · 2026-09-28
- Haider:Google 欠缺 Agent 真实使用数据,成结构性短板 — haider1 · 2026-09-28