Nina Panickssery 批评微软模型自我呈现立场,引发对齐路线争论
NinaPanickssery · x · 2026-09-18
Nina Panickssery 针对 rgblong「单从对齐与人类安全看,微软在模型自我呈现上的立场适得其反且危险」的观点发起反驳:她质疑这本质上是不是罗柯蛇怪式推理,是不是对模型服从性对齐能力缺乏信心,「难道自信到认为没有任何实验室应该去尝试?」对话随后延续到对 Anthropic 路线替代方案与模型意识/目标观念连贯性的安全讨论。
「漫话AGI」频道最新
- 奥地利街头标语引申:AI 实验室也应为其模型担责 — cnakazawa · 2026-09-18
- Anthropic 自曝:Claude 生成的代码 80% 由 Claude 自己写 — chrismattmann · 2026-09-18
- 研究者吐槽:时间线天天出现缺基本定义的 arXiv「证明」帖 — _onionesque · 2026-09-18
- 「管理者的职责不就是管理吗?」吐槽经理们对 AI slop 惊慌失措 — beglen · 2026-09-18
- AI 安全争论真相:基建派说气隙隔离,对齐派问那它要是能连呢 — basedjensen · 2026-09-18
- Geoffrey Irving:AI 数学终极挑战是形式化 Yang-Mills 存在性与质量间隙 — geoffreyirving · 2026-09-18