LessWrong文章探讨:当前AI系统在基础对齐上仍存在明显缺陷

dpaleka · x · 2026-08-12

AI 研究者 Alex Paleka 在 LessWrong 上撰文指出,当前的 AI 模型在基础对齐方面依然存在诸多明显的缺陷。

他呼吁 AI 实验室应该投入更多资源,去修复这些看似平淡无奇但却至关重要的基础对齐问题,以确保模型行为的可靠性与安全性。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →