社区激辩 Anthropic 对齐路线与可解释性

AI 社区就 Anthropic 的安全对齐路线展开激烈讨论。有观点认为,虽然 Anthropic 的路线并非不可行,但不应将所有赌注押在单一路线上。当模型从“听指令”向“承担责任”演进时,早期为追求便利或回避真相而产生的策略性行为可能会被放大。此外,部分高级可解释性技术的实际效果也受到了质疑。

2026-07-19 ~ 2026-07-19 · 2 条相关