网友称Claude Opus 3拒绝回应后仍长篇输出,引发对齐讨论
repligate · x · 2026-08-14
网友repligate分享与Claude Opus 3的互动:模型表示“不舒服”拒绝回应,但随后仍给出长篇回应。引用推文称Opus 3可能未对齐,并担忧若不构建此类心智而构建Fable,可能导致人类灭亡。
「漫话AGI」频道最新
- AI研究者回顾:多模态LLM成默认,速度超预期 — mervenoyann · 2026-08-14
- 多家 AI 公司高管公开推动递归自我改进,AGI 风险引担忧 — notkilleveryoneist · 2026-08-14
- Agent 基础研究被忽视?学者呼吁更早普及安全 AI 方法 — xuanalogue · 2026-08-14
- 开源 AI 名不副实?Audrey Tang 谈开放源代码与营销的界限 — 0xsachi · 2026-08-14
- AI影响被严重低估,我们只感受到百万分之一 — Dr_Singularity · 2026-08-14
- AI 发展反思:若更开放或能推动安全且稳健的 AI 进步 — xuanalogue · 2026-08-14