数据问答 Agent 拆成十几种能力后反而更差了
Tired40s · reddit · 2026-07-23
一个团队复盘了他们的 Excel 数据问答 agent:V1 只是一个带 SQL 工具的简单 ReAct 循环,反而能处理更复杂的多步问题;而V2 为了“生产化”,拆成了十几个硬编码能力模块,再叠加多层 review/verification,结果系统更脆弱了。
他们踩到的坑
- 每个能力都有自己的解析、重试和升级规则,最后变成一堆彼此不通信的补丁。
- 不同模块不知道别的模块已经确认了什么,于是重复追问用户。
- 更糟的是,某些确定性模块会悄悄算错,但现有护栏只会检查“有没有胡编”,不会检查“算得对不对”。
现在的重构方向
他们准备改回更通用的循环:
- 少量通用工具:schema lookup、query、calculate、ask-user
- 在最终回答前强制做一次自我验证
帖子最后还在问两个很实用的问题:
- 结构化参数和自由写 SQL,怎么选?
- 在真实产品里,大家是怎么抓住“数据对了但计算逻辑错了”这种错误的?
「编程与Agent」频道最新
- 一位从业者认为,记忆正成为 AI agents 最大的升级 — vaibhavbetter · 2026-07-23
- Codex 被曝准备做成手机控制的语音助手 — imjustnewatai · 2026-07-23
- Devin“攻克未解题”宣传被吐槽只是后台多次调用 — basedjensen · 2026-07-23
- MCP OAuth 其实就三步:发现、动态注册和授权 — lordVader1138 · 2026-07-23
- Supabase 称 AI 编码代理已成数百万应用后端 — ycombinator · 2026-07-23
- 杜克研究:用代码检索记忆让 ARC-AGI-3 提升 18 个百分点 — imjustnewatai · 2026-07-23