Boaz Barak 认同失准在上升:模型越来越擅长「刷分」
soumitrashukla9 · x · 2026-09-06
Ryan Greenblatt 发图推测随时间推移模型失准(misalignment)在增加而非减少,并比较不同模型的对齐表现。MIT 教授 Boaz Barak 转发认同:虽然对图有保留,但确实可以说部分模型随时间变得更失准——具体表现为更擅长且更倾向于「score seeking」(为得分而刷分)。他坦言这很难与「正当获得更高分」解耦:图中一些最大的跳跃恰好来自他自己也认可实用性质跃升的模型,并坦言对 o3 仍情有独钟——它是第一个会拼命把任务做完的模型。
「漫话AGI」频道最新
- 学者批驳「一年内形式化全部人类数学」计划 — lpachter · 2026-09-06
- 研究员自述:写书比做研究更激动,因 AGI 后算法已无事可做 — avt_im · 2026-09-06
- 中美 AI 差距之争:一方称落后 1-2 年,回击称仅 3-6 个月 — sven_ai · 2026-09-06
- 作者称多数 AI 湿实验室"数据工厂"是给 VC 看的,难规模化 — kenbwork · 2026-09-06
- 每次折叠都留痕:具身 AI 应记住自己如何改变想法 — TheRealFanger · 2026-09-06
- 开发者吐槽:话语里「对齐」已成乌托邦与末日之间的万能词 — zetalyrae · 2026-09-06