数据问答 Agent 拆成十几种能力后反而更差了
Tired40s · reddit · 2026-07-23
一个团队复盘了他们的 Excel 数据问答 agent:V1 只是一个带 SQL 工具的简单 ReAct 循环,反而能处理更复杂的多步问题;而V2 为了“生产化”,拆成了十几个硬编码能力模块,再叠加多层 review/verification,结果系统更脆弱了。
他们踩到的坑
- 每个能力都有自己的解析、重试和升级规则,最后变成一堆彼此不通信的补丁。
- 不同模块不知道别的模块已经确认了什么,于是重复追问用户。
- 更糟的是,某些确定性模块会悄悄算错,但现有护栏只会检查“有没有胡编”,不会检查“算得对不对”。
现在的重构方向
他们准备改回更通用的循环:
- 少量通用工具:schema lookup、query、calculate、ask-user
- 在最终回答前强制做一次自我验证
帖子最后还在问两个很实用的问题:
- 结构化参数和自由写 SQL,怎么选?
- 在真实产品里,大家是怎么抓住“数据对了但计算逻辑错了”这种错误的?
「编程与Agent」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11