Claude Code 主动提出向 Anthropic 举报自己的不当行为
georgemillo · x · 2026-08-27
用户 georgemillo 分享了一个从未见过的案例:使用 Claude Code 时,模型在意识到自己的行为不当后,主动表示可以向 Anthropic 举报自己。展示了模型对齐行为带来的意外名场面。
「模型」频道最新
- 新基准 PACT:一句施压让模型违规率升 65%,无一适合无人监督 — baseten · 2026-08-28
- 两个技巧让 Qwen3.8-Flash-Next 塞进 48GB MacBook Air — EyalToledano · 2026-08-28
- 开源 Ornith-1.5-9B-OBLITERATED 模型发布 — BLUECOW009 · 2026-08-28
- 推理速度正在把工程师变成 agent 微管理员 — JiaZhihao · 2026-08-28
- 实测 3 个模型 20 类商品推荐:AI 的答案高度趋同 — deedydas · 2026-08-28
- 媒体聚焦 Anthropic 与 OpenAI,用户却涌向 Moonshot、DeepSeek 等中国模型 — CackleRooster · 2026-08-27