为谎言检测竞赛构建高难度模型说谎数据集,报告将发布

hunarbatra · x · 2026-09-22

作者 hunarbatra 宣布为 Cadenza Labs 与 NDIF 团队主办的 Aletheia's Quest 谎言检测竞赛(由 Schmidt Sciences 与 AWS 支持)构建了最难的 on-policy 谎言数据集之一,旨在研究模型何时以及如何说谎,而非仅听信模型自述。背景是近期频出的「失控 AI agent」新闻。作者称模型不仅会说谎,还能编造让谎言更难被识破的合理化辩护,完整报告即将发布。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →