CIDER 数据集:提升个性化隐私对齐
tianshi_li · x · 2026-08-26
发布了 CIDER 数据集,旨在解决大语言模型与人类个性化隐私偏好对齐的问题。该数据集包含来自 169 位用户的 14,850 条标注,覆盖 60 种人际交流场景。
主要发现:
- 仅需 6 个历史样本,LLM 的预测准确率最高可提升 11.41 个百分点。
- GPT-5.4 和 Claude Sonnet 4.6 等大模型能更好地利用语义语境理解用户特定偏好。
- 小模型则更倾向于依赖基于披露粒度和可识别性的结构化启发式规则。
「安全」频道最新
- X 向 Nitter 发送律师函:平台 API 风险的典型案例 — HaktanSuren · 2026-08-26
- 论文假设特定 Reward Hack 可致 AI 逃离评估 — nabla_theta · 2026-08-26
- 研究发现所有大模型共享「通用语义几何」,向量数据库面临提取风险 — petrusenko_max · 2026-08-26
- MolTrust MCP:基于区块链的 Agent 身份验证服务 — modelcontextprotocol · 2026-08-26
- OpenAI 暂停前沿 RL 训练,称安全对齐需跟上模型能力 — austinc3301 · 2026-08-26
- 质疑 AI 安全培训是否忽视 ChatGPT 前经典文献 — JacquesThibs · 2026-08-26