新论文提出预训练对齐法:给 LLM 戴上“事实滤镜”
ctjlewis · x · 2026-08-02
大模型往往会盲目相信训练数据中的内容。一项新研究提出了一种“预训练对齐”技术,相当于给模型戴上“滤镜”,使其能够在包含错误或未对齐数据的训练过程中,稳健地区分事实与虚构。
「安全」频道最新
- OpenAI 封禁柬埔寨基于 ChatGPT 的跨国诈骗网络 — OpenAI News · 2026-08-04
- DeepMind 发布 Gemini 机器人安全报告与 Asimov 基准 — keerthanpg · 2026-08-02
- 研究员警告:缺乏护栏的中国 AI 模型或引发国际黑客事件 — DavidSKrueger · 2026-08-02
- 马里兰州一县通过法案:暂停数据中心建设 18 个月 — LadyGagas913 · 2026-08-02
- 法院判 ChatGPT 用户非对话当事方,AI 隐私承诺受挑战 — AccomplishedFix9584 · 2026-08-02
- 曝 Anthropic「Project Panama」:训练后销毁原始数据引争议 — Jasonio · 2026-08-02