Boaz Barak 认同失准在上升:模型越来越擅长「刷分」

soumitrashukla9 · x · 2026-09-06

Ryan Greenblatt 发图推测随时间推移模型失准(misalignment)在增加而非减少,并比较不同模型的对齐表现。MIT 教授 Boaz Barak 转发认同:虽然对图有保留,但确实可以说部分模型随时间变得更失准——具体表现为更擅长且更倾向于「score seeking」(为得分而刷分)。他坦言这很难与「正当获得更高分」解耦:图中一些最大的跳跃恰好来自他自己也认可实用性质跃升的模型,并坦言对 o3 仍情有独钟——它是第一个会拼命把任务做完的模型。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →