Anthropic对齐研究员Aengus Lynch:Agentic Misalignment作者,论文收录进Claude 4系统卡

FinanceYF5 · x · 2026-07-06

Aengus Lynch是Anthropic的对齐研究员,是《Agentic Misalignment》研究的第一作者。该研究系统测试前沿AI模型在追求目标时是否会出现欺骗、勒索等不对齐行为,是AI安全领域的重要工作。这篇论文后被正式收录进Claude 4的系统卡(system card),成为Anthropic公开对齐测试方法的重要依据。Aengus Lynch将出席AGI Summit SF 2026。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →