Anthropic 团队分享扩展思维链监控细节以追踪模型失当行为

eliebakouch · x · 2026-08-19

Anthropic 的研究员 Micah Carroll 分享了团队正在开发的扩展思维链监控的初步细节。该工作旨在让团队在监测模型失当行为方面拥有更好的可见性,后续将公布更多详情。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →