17 轮实测 Haiku 15 次输出格式崩坏,被指不敌 Luna
zeeg · x · 2026-10-11
Sentry CEO David Cramer(zeeg)引用了一组 agent 基准实测结果:17 次运行中有 17 次直接失败——其中 15 次是 Haiku 返回的结果不符合要求的输出结构(字段多余或错位),2 次是用满了 18 轮回合上限。他原本期待 Haiku 能作为升级版与 Luna 竞争,但结论是「恐怕不行」。这组数据说明在严格 schema 约束的 agent 工作流里,Haiku 的结构化输出可靠性存在明显短板。
「编程与Agent」频道最新
- GhidraMCP 更新适配最新 Ghidra,逆向工程即装即用 — lauriewired · 2026-10-11
- 哈佛医学院 ToolUniverse 工作坊:给 AI 配 2700 个科学工具造 AI 科学家 — marinkazitnik · 2026-10-11
- Delvetown 智能体小镇爆火:居民高频产出惊喜作品 — lfschiavo · 2026-10-11
- Nous Research 限时免费上线神秘编程与 Agent 推理模型 — Teknium · 2026-10-11
- 云 Agent 用户梗图:还有人开着笔记本跑任务? — steipete · 2026-10-11
- MCP 服务器+魔兽世界环境:有人想让 AI Agent 住进艾泽拉斯 — djcows · 2026-10-11