Anthropic 对齐负责人:无安全名义的团队也在热忱推动对齐训练
kaicathyc · x · 2026-09-05
Anthropic 员工 kaicathyc 分享了对齐评测负责人 Sam Arnesen 的一句话:「很多这些(训练)工作是由名称里不带『安全』或『对齐』的团队满怀热情推动的。」
- post-training 环节的工作由 Yann Dubois 的团队承担,作者特别致谢。
- 模型开发流水线中更靠前的多个团队也与对齐/安全团队紧密合作,在整个训练过程中测量并改进对齐。
- 作者强调公司内有许多人深切关注把这件事做对。
这条帖子透露了 Anthropic 内部对齐工作的组织方式:对齐并非安全团队的专属职责,而是嵌入了整个训练流程。
「漫话AGI」频道最新
- 开发者回应质疑:客户自研方案屡失败,人类短期内仍在环 — gdechichi · 2026-09-05
- 定制方案商:客户自建 AI 失败才养活了我的生意 — gdechichi · 2026-09-05
- AI 风险怀疑派学者自认看错:失控风险已不再模糊 — dhadfieldmenell · 2026-09-05
- 猎巫竟是最优社会协调屏障?Scott Alexander 名言再流行 — shakoistsLog · 2026-09-05
- 开发者直言:写代码的技能时代已结束,底层功力仍不可缺 — UhGoomba · 2026-09-05
- mark_k:AI 粉丝圈已像球迷部落,面对「反 AI 派」该放下骂战 — mark_k · 2026-09-05