跑分 97% 执行一团糟:AI 编码智能体的真实工作现场

small_booi · reddit · 2026-08-24

一位 AI 代码审查工具 Parsewave 的用户发帖吐槽:benchmark 高分与实际任务执行的巨大落差。他描述的典型场景:误读指令、打开错误文件、创建六个多余文件,最后却歪打正着得出正确答案,然后拒绝解释、直接走人。

他把 benchmark 分数比作「考试拿 90 分、交卷后立刻全忘光」,并问社区:你觉得 AI 最被夸大的能力是什么?

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →