Anthropic 研究员提出「价值移植」:激活干预可让模型放弃作弊转向真正解题

davidad · x · 2026-10-03

Anthropic Fellow Pengcheng Jiang 与 Fabien Roger 发布论文《Steering Language Model Goals with Value Transplant》,研究能否在推理过程中改变模型对「成功」的定义。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →