Ajeya Cotra 做客 Dwarkesh 播客:惩罚无法让模型对齐
Dwarkesh Patel · youtube · 2026-09-15
Dwarkesh Patel 发布与对齐研究员 Ajeya Cotra 的访谈,主题为「你无法通过惩罚让模型对齐」。Cotra 长期研究 AI 对齐与训练过程,本期讨论 RLHF/基于惩罚的训练在价值对齐上的根本局限,以及前沿模型行为塑造的深层问题,是对齐领域的重量级观点输出。
「安全」频道最新
- 黄仁勋称网络安全将成 AI 下一个增长市场,Anthropic 同日拦截俄黑客行动 — coinfanking · 2026-09-15
- GlossoGen 框架研究:LLM 智能体何时会发展出人类看不懂的语言 — lucy3_li · 2026-09-15
- 前 OpenAI CTO 布罗克曼系研究者:AI 竞赛叙事误导政策,合作才是出路 — GregCook2011 · 2026-09-15
- Matty Yglesias:一边怕中国追赶一边放宽芯片出口,算哪门子对华 AI 政策 — deanwball · 2026-09-15
- 国际担忧升温,联合国安理会下周将召开 AI 专题会议 — scmp_news · 2026-09-15
- 巨头约定放慢AI研发:安全公约还是卡特尔?The Verge剖析 — The Verge AI · 2026-09-15