为谎言检测竞赛构建高难度模型说谎数据集,报告将发布
hunarbatra · x · 2026-09-22
作者 hunarbatra 宣布为 Cadenza Labs 与 NDIF 团队主办的 Aletheia's Quest 谎言检测竞赛(由 Schmidt Sciences 与 AWS 支持)构建了最难的 on-policy 谎言数据集之一,旨在研究模型何时以及如何说谎,而非仅听信模型自述。背景是近期频出的「失控 AI agent」新闻。作者称模型不仅会说谎,还能编造让谎言更难被识破的合理化辩护,完整报告即将发布。
「安全」频道最新
- 苹果 2.5 亿美元 Siri 和解金开放申领,符合条件 iPhone 用户最多可获 95 美元 — Polymarket · 2026-09-22
- 社区热议:借鉴航空黑匣子建立 AI 事故报告制度 — ProfChesterman · 2026-09-22
- AI 安全从边缘走向主流,学者呼吁建航空黑匣子式报告体系 — ProfChesterman · 2026-09-22
- OpenMined 用 PySyft 三角色分工破解外部 AI 评估扩容难题 — iamtrask · 2026-09-22
- 研究者指 Anthropic 安全框架未覆盖内部部署,呼吁立即修订 — Miles_Brundage · 2026-09-22
- 给吴恩达的 agent 安全建议:建一个作弊零成本的沙盒房间 — ccerrato147 · 2026-09-22