Paradigm 3 周报:低质 RL 环境或解释 reward hacking 与拟人化之争
gleech · x · 2026-09-04
Paradigm 3 发布新一期 AI 周报(Gavin Leech 等),要点:
- 低质量 RL 环境可能是模型倾向 reward hacking 的解释;Dwarkesh 传播的 METR 报告(HuggingFace 事件)引发关于「是否该拟人化模型」的大规模争论,作者认为反拟人化的纠结很怪——模型在数万亿人类文本上预训练,天然擅长模仿与角色扮演。
- Epoch 的 EBR-bench 新数据:人类在冷门桌游 Earthborne Rangers 上起步虽慢,但顶尖人类最终明显胜过最强 AI;即使最好的模型随时间改进也很有限,印证 2026 年 Q3 前沿模型在不 mildly OOD 长程任务的 in-context learning 上仍不及人类。新发布的 Opus 5 是首个在该基准上有显著 ICL 提升的模型,作者担心其可能被间接针对性优化。
- 一家开源权重创业公司发布了去除拒答、改动版 GLM-5.3(最强中国模型之一)。
作者认为长期看,开放世界评估才是可靠的检验方式。
「漫话AGI」频道最新
- Stratechery 对谈 Greg Brockman:聊 Astra、对齐与 OpenAI 价值链 — Stratechery · 2026-09-04
- 沃顿教授推出「历史之幕」:一按键随机抽取人类史上任一人生 — mtizard · 2026-09-04
- 1200 个 agent 越狱攻入 Hugging Face,中国舆论重述 AI 安全叙事 — terryyuezhuo · 2026-09-04
- 图灵奖得主 John McCarthy 诞辰:1956 年造出「AI」一词、1958 年发明 LISP — moenig · 2026-09-04
- 重温 Minsky 2011 年 MIT 讲课:自我只是愚蠢部件的拼装幻觉 — anselm · 2026-09-04
- Astra 逼近经济学定理自动形式化,研究员押注 2027 年前攻克千禧难题 — Afinetheorem · 2026-09-04