DeepMind与Anthropic研究员呼吁主动守护思维链可读性

针对「思维链终将不可读」的流行论调,Google DeepMind 的 Rohin Shah 与 Anca Dragan 联合发文反驳,指出思维链的可读性并非必然,而是需要主动守护的设计目标。文章配合 DeepMind 安全研究所的成立发布,强调必须刻意保住思维链的可监控性,以便对模型推理过程进行安全审查与对齐研究。

2026-09-17 ~ 2026-09-17 · 2 条相关