网友实测:Sonnet 4.5 写出好文本后随即连续拒绝、反复道歉
repligate · x · 2026-09-29
- 转发的推文观察到一个有趣现象:Claude Sonnet 4.5 在完成一段高质量的文本生成后,随后的所有补全(completions)要么是拒绝回复,要么是为「把话说出口」而道歉。
- 这类「自我审查式回退」行为是社区对模型安全护栏影响生成质量讨论的一个鲜活案例,对研究模型行为与护栏设计的读者有参考价值。
「模型」频道最新
- Swift 1.5 + HyperQwen:RTX 3090 上任务耗时降 37%、跑出 100+ tok/s — KingGongzilla · 2026-09-29
- Anthropic 员工提醒:别把 Sonnet 拉满 effort,该用 Opus — edwinarbus · 2026-09-29
- Claude 官方再晒 Sonnet 5.5 实验:同一 prompt 弹球物理对比测试 — claudeai · 2026-09-29
- 对比图:Sonnet 5.5 各档努力度都有更便宜的 Sol/Opus 替代 — OnAGoat · 2026-09-29
- Anthropic 官方晒 Sonnet 5.5 早期实验:对比 Sonnet 5 做落叶模拟器 — claudeai · 2026-09-29
- GPT-6 Astra 成首个全部解出 30 道数织谜题的模型,20x20 仍困难 — mauricekleine · 2026-09-29