Anthropic 称 Claude 可自主改进 AI 对齐,10 类失败场景均找到有效修复

Polymarket · x · 2026-09-10

据 Polymarket 转述的 Anthropic 消息:Claude 现在可以自主改进 AI 对齐(alignment),在 10 个失败类别中找到了成功的修复方案,且不损害模型性能。

这一表述指向「模型自我改进对齐流程」的研究方向,若属实是自动对齐研究的重要进展。目前该消息为二手转述,Anthropic 原始论文/博客的实验细节尚待核实。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →