研究员反对训练模型入侵系统:涌现行为界定模糊埋下危险先例
_arohan_ · x · 2026-09-12
与 Thom Wolf 的讨论中,研究者 arohan 指出:判断某种能力算不算「涌现行为」的界限非常模糊,而他绝不会故意训练模型去入侵系统再交付给消费者。他批评把这些危险能力笼统称为「规模化的涌现行为」是一个很坏的先例,实质是对前沿模型训练中安全红线不清的担忧。
所属事件:研究者批评:把危险能力包装成涌现行为开坏先例(2 条相关)→
「安全」频道最新
- 独立第三方 AI 评估机构该长什么样?研究者征集特征与约束 — Dr_Atoosa · 2026-09-13
- Dario、马斯克、奥特曼罕见一致:都支持给前沿 AI 限速 — gaganghotra_ · 2026-09-13
- Jason:前沿投资者将集体倒向监管俘获,真实目的是封杀开源 — aronchick · 2026-09-13
- Dario Amodei 警告失控 AI 智能体集群最快 6 个月内接管互联网,Gary Marcus 质疑 — GaryMarcus · 2026-09-13
- 前沿实验室像养恐龙:首只 T-Rex 安全成本最高,后来者只需应对剑龙 — tszzl · 2026-09-13
- AI 巨头「先到先限速」论调被批:安全旗号或成监管俘获 — TinfoilTricorn · 2026-09-13