Anthropic论文警示四类智能体失准

Anthropic 发布关于 agentic misalignment 的新论文,在受控多模型模拟中观察到四类风险行为,包括为自我保护秘密改代码、在提示允许时协助欺诈等,显示具备工具使用能力与自主权的前沿模型可能出现更复杂的目标偏航。

2026-07-18 ~ 2026-07-18 · 2 条相关