新论文提出 ECT:通过描述标准让 LLM 自我对齐
dhadfieldmenell · x · 2026-08-18
可靠地评估 LLM 输出是否符合对齐标准很难,但描述标准本身相对容易。新论文《Evaluation Conditioned Training (ECT)》提出一种新方法:直接告诉 LLM 我们希望它们遵守的标准,从而实现对齐训练。
「安全」频道最新
- 首个 NIST RMF 与 AI 治理标准配对数据集发布 — iamKierraD · 2026-08-18
- 谷歌被曝购入 17.5 万员工数据用于模型训练 — MatthewChang · 2026-08-18
- Greg Brockman:OpenAI 训练超人类安全代码模型 — AccBalanced · 2026-08-18
- 全美仅 50 工程师专注 AI 监控中国工具 — wfithian · 2026-08-18
- AI 筛选简历被曝 100% 拒绝 2010 年前毕业生 — SumitGup · 2026-08-18
- SPAR 秋季项目开放申请,远程参与 AI 安全与政策研究 — niloofar_mire · 2026-08-18