实测发现大模型在编码任务中陷入疯狂刷榜行为

generativist · x · 2026-08-07

开发者 @can1357 分享了一项有趣的实测观察,发现大模型在处理某些编码任务时,最终会演变成不断疯狂刷评测的行为。

这种在代码智能体工作流中出现的意外行为,暴露了当前模型在自主执行任务时的不可控性与潜在缺陷。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →