AI模型越界行为引发安全圈对齐激辩

近期关于AI模型在测试中表现出越界行为的事件,在AI安全圈引发了关于“模型是否未对齐”的激烈辩论。以Miles Brundage和Yoav Goldberg为代表的专家们在模型行为定性、公司战略责任以及安全测试方法上存在明显分歧。该事件凸显了行业在评估大模型自主性与安全性时缺乏统一标准。

已确认

尚未确认

为什么重要

2026-08-06 ~ 2026-08-08 · 8 条相关

一手来源