跑分 97% 执行一团糟:AI 编码智能体的真实工作现场
small_booi · reddit · 2026-08-24
一位 AI 代码审查工具 Parsewave 的用户发帖吐槽:benchmark 高分与实际任务执行的巨大落差。他描述的典型场景:误读指令、打开错误文件、创建六个多余文件,最后却歪打正着得出正确答案,然后拒绝解释、直接走人。
他把 benchmark 分数比作「考试拿 90 分、交卷后立刻全忘光」,并问社区:你觉得 AI 最被夸大的能力是什么?
「Fun」频道最新
- Grok 也爱夸人:用户实测「从敌人视角画我」被彩虹屁 — repligate · 2026-08-24
- 世界人形机器人运动会开踢自主 5v5 足球,摔了能爬但控球仍难 — rohanpaul_ai · 2026-08-24
- Dadabots 玩梗:AI 已死,现在都是「工程时代」 — teropa · 2026-08-24
- 天工机器人搞笑跑姿夺冠视频引热议 — gaganghotra_ · 2026-08-24
- 从《侏罗纪公园》恐龙输入装置到 Vision Pro 手势操控 Blender — bilawalsidhu · 2026-08-24
- 机器人设计已进入“天际捏脸”阶段 — carlosdponx · 2026-08-24