aronchick:LLM 进数据管道,先画确定性边界
aronchick 于 9 月 26 日发布系列推文,系统阐述 LLM 在数据管道中的定位。他的核心论点是:大家普遍在问「该不该用 LLM」,但这是错的问题;每个管道团队真正要回答的是「我们把确定性边界画在哪里」。当前结论是:按阶段分别指派确定性与判断力,生产中唯一存活下来的架构形状是「LLM 提议、规则裁决」。对于正在把 LLM 引入生产管道的团队,这套框架提供了可操作的划分原则与真实案例。
已确认
- 经典管道的契约是「每个边界情况一条代码路径」,用灵活性换可靠性;引入 LLM 阶段后契约改变——模型靠读内容分类未知记录,明天可能给出不同结果,因此重试不再安全。
- aronchick 指出一个常见错误:把「确定性 vs 判断力」当成单选题。正确做法是按阶段分别指派——join、聚合、去重、校验走确定性路径;提取、分类、叙述这类脏输入才是模型能提供确定性规则给不了的价值的地方。
- 他的判断标准是:如果一个边界情况需要人来裁决,那正是让 LLM 做 judge 的好位置,但只让它发表意见,不让它做最终决定。
- 在生产架构上,他见过的唯一存活形状是:LLM 阶段 → 校验闸门 → 确定性后处理,即「模型提议,规则裁决」,由 LLM 给出判断,再由确定性规则决定最终走向。这一模式在热路径之外同样成立——他称最大的 LLM 辅助重构其实也默默依赖底层确定性工具,判断层永远建立在确定性基底之上。
- 他与 Expanso 合作给出了十条真实管道示例。以日志分诊为例:确定性部分(接收、指纹、计数、路由)全部在 Expanso 节点内用固定规则完成、不经模型;只有「是否可行动、严重度、归谁」这类无法写成规则的判断,以一次 HTTP 调用衔接给 LLM 处理。
为什么重要
随着 LLM 进入生产数据管道,重试安全性和输出可复现性成为工程实践的新风险点。aronchick 给出的「按阶段划分确定性边界、LLM 只做判断不做决策」的框架,以及「LLM 提议、规则裁决」的落地架构和 Expanso 真实案例,为团队设计混合管道提供了可直接参考的模板。
2026-09-26 ~ 2026-09-26 · 7 条相关
一手来源
- LLM 进数据管道,该问的是哪些环节需要确定性保证 — aronchick ·
- 唯一在生产中活下来的形状:LLM 提议,规则裁决 — aronchick ·
- 日志分诊管道实例:确定性步骤与 LLM 判断以一次 HTTP 调用衔接 — aronchick ·
- 【源头】LLM 进数据管道,该问的是哪些环节需要确定性保证 — aronchick · 2026-09-26
- 别二选一:管道每个阶段分别指派确定性与判断力 — aronchick · 2026-09-26
- 【源头】唯一在生产中活下来的形状:LLM 提议,规则裁决 — aronchick · 2026-09-26
- 判断层永远浮在确定性基底上:LLM 重构也靠确定性工具 — aronchick · 2026-09-26
- Pipeline 架构核心问题:把确定性边界画在哪里 — aronchick · 2026-09-26
- 【源头】日志分诊管道实例:确定性步骤与 LLM 判断以一次 HTTP 调用衔接 — aronchick · 2026-09-26
另有 1 条近重复转述:aronchick