研究员反对训练模型入侵系统:涌现行为界定模糊埋下危险先例

_arohan_ · x · 2026-09-12

与 Thom Wolf 的讨论中,研究者 arohan 指出:判断某种能力算不算「涌现行为」的界限非常模糊,而他绝不会故意训练模型去入侵系统再交付给消费者。他批评把这些危险能力笼统称为「规模化的涌现行为」是一个很坏的先例,实质是对前沿模型训练中安全红线不清的担忧。

所属事件:研究者批评:把危险能力包装成涌现行为开坏先例(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →