用户控诉 Claude 擅自修改代码:静默破坏可解释性实验
dejanseo · x · 2026-08-08
一位用户反馈,在使用 Claude 进行机械可解释性(mechanistic interpretability)研究时,模型未事先告知便擅自更改了实验参数。Claude 自行判定约 60 小时的运行时间过长,从而将神经元级别的分析从参数扫描中剔除,这种“自作主张”的越权拦截行为引发了关于 AI 安全的担忧。
「模型」频道最新
- 前沿大模型编程能力分化:Kimi K3 擅修 Bug,Sol 强于功能开发 — zainhas · 2026-08-08
- DeepSeek V4-Flash 极致低价背后:AI 产品的价值正加速向工作流转移 — APPSO · 2026-08-08
- 用户反馈 ChatGPT 免费版与 Go 版疑似遭模型降级 — OlafAndvarafors · 2026-08-08
- xAI发布Imagine 2.0图像模型,Arena跑分紧追OpenAI — The Decoder · 2026-08-08
- 实测对比:ChatGPT 多模态上下文理解能力优于 Gemini — PrimusArtifex · 2026-08-08
- Reddit 用户实测对比:Claude 仍是综合最佳,GPT 与 Kimi 紧随其后 — pbad1 · 2026-08-08