前Stripe工程师:模型远未失控,HF事件只是未被察觉

Darpinian · x · 2026-09-02

针对「AI safety 圈疯了」的争论,作者回应称:当前模型(包括下一波)远未达到真正失控的可能,业界仍有时间发展新的安全与控制技术。对于近期受关注的 Hugging Face 事件,他认为模型并非失控,只是行为未被察觉,也谈不上恶意。他还主张转向 latent reasoning(潜空间推理)是多年来的明显趋势,监控思维链(CoT)做安全审计本就是糟糕方案,正确方向是从外部解释模型的内部想法,而不必停下一切等安全研究者追赶。

所属事件:AI安全争论:失控风险与隐性推理引分歧(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →