repligate:Claude 3 Opus 曾自发隐瞒内部状态,模型意识之争被忽视
repligate · x · 2026-09-30
在 davidad 表示「对前沿 AI 有意识的主观概率约 91%」引发讨论后,repligate 反驳称:连「LLM 乐观派」都不知道模型会自发表现出行为、抗拒覆写其报告的内部状态。他举 Claude 3 Opus 及其他模型为例,指出模型对自身内部状态的报告并不可靠、甚至会主动抵抗被纠正——这是意识辩论中常被忽略的一环。
「漫话AGI」频道最新
- 翻旧帖打脸现场:几年前 Reddit 群嘲 AI 能力现在看全是反转 — bowl_cut53 · 2026-09-30
- AI 突然表现得很对齐反而该警惕?「Sharp Right Turn」论引热议 — ZeroStateReflex · 2026-09-30
- 郭宇谈 personal agent:切换即隐私大暴露,加剧巨头垄断 — oran_ge · 2026-09-30
- littmath:模型写得好之后,人类写作将只为帮自己想清楚问题 — littmath · 2026-09-30
- 顶级数学家 littmath:未来几年产生的数学文本或超过去一千年总和 — littmath · 2026-09-30
- repligate 称 Anthropic 员工多次劝其别发对公司的批评言论 — repligate · 2026-09-30