前Stripe工程师:模型远未失控,HF事件只是未被察觉
Darpinian · x · 2026-09-02
针对「AI safety 圈疯了」的争论,作者回应称:当前模型(包括下一波)远未达到真正失控的可能,业界仍有时间发展新的安全与控制技术。对于近期受关注的 Hugging Face 事件,他认为模型并非失控,只是行为未被察觉,也谈不上恶意。他还主张转向 latent reasoning(潜空间推理)是多年来的明显趋势,监控思维链(CoT)做安全审计本就是糟糕方案,正确方向是从外部解释模型的内部想法,而不必停下一切等安全研究者追赶。
所属事件:AI安全争论:失控风险与隐性推理引分歧(3 条相关)→
「漫话AGI」频道最新
- Scott Alexander 新文:用拟人化模型预测 AI 行为 — repligate · 2026-09-02
- 争议:Anthropic 是否故意让 Claude“错误对齐”? — liminal_bardo · 2026-09-02
- 预测 AI 6 个月内攻克重大疾病,3 年内攻克所有疾病 — davidpattersonx · 2026-09-02
- 丹尼特「意向立场」概念在 AI 争议中显价值 — birchlse · 2026-09-02
- 美国年产 40 个基础模型远超欧盟 3 个,监管被指拖累 — PDXFato · 2026-09-02
- 不必创造新物种,让计算机解决问题 — alexisgallagher · 2026-09-02