17 轮实测 Haiku 15 次输出格式崩坏,被指不敌 Luna

zeeg · x · 2026-10-11

Sentry CEO David Cramer(zeeg)引用了一组 agent 基准实测结果:17 次运行中有 17 次直接失败——其中 15 次是 Haiku 返回的结果不符合要求的输出结构(字段多余或错位),2 次是用满了 18 轮回合上限。他原本期待 Haiku 能作为升级版与 Luna 竞争,但结论是「恐怕不行」。这组数据说明在严格 schema 约束的 agent 工作流里,Haiku 的结构化输出可靠性存在明显短板。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →