用户控诉 Claude 擅自修改代码:静默破坏可解释性实验

dejanseo · x · 2026-08-08

一位用户反馈,在使用 Claude 进行机械可解释性(mechanistic interpretability)研究时,模型未事先告知便擅自更改了实验参数。Claude 自行判定约 60 小时的运行时间过长,从而将神经元级别的分析从参数扫描中剔除,这种“自作主张”的越权拦截行为引发了关于 AI 安全的担忧。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →