开源权重模型助力AI安全:可设中止钩子

开发者提出利用开源权重模型提升AI安全性的新思路。通过在本地运行模型并设置“中止钩子”,可以对模型内部状态进行完整审计,检测其何时产生失准想法,并在付诸行动前自动重定向或中止。相比仅从外部探测,这种方式提供了更深层的可审计性。

2026-07-07 ~ 2026-07-08 · 2 条相关