工业寄存器表格分类惨败:Prompt 还是微调问题?
Plenty_Shine_8250 · reddit · 2026-08-21
作者构建了一个将工业通信手册转换为标准化目录的流水线,核心环节是使用 LLM 对表格进行分类和列角色映射。在测试中,Fireworks Qwen 3.7 Plus 在分类上表现尚可但过度分类,且在列映射任务上表现糟糕(F1=50%),经常遗漏列或给出错误映射(如将 bitoffset 误判为 address)。相比之下,本地 4B 模型在映射任务上反而更优。作者分析原因可能在于 JSON Schema 指令与模型思维模式的冲突,并探讨这究竟是 Prompt/Schema 设计问题,还是必须转向微调。
「编程与Agent」频道最新
- M 系列 Mac 运行 Firecracker 的嵌套虚拟化实践 — dejavucoder · 2026-08-21
- Vibe Coding 止步于 SaaS?为何没人用它写内核 — Fowe · 2026-08-21
- 设计AI代码审查Agent:如何选历史参考类估算风险? — Accomplished-Fun4629 · 2026-08-21
- 腾讯发布 HyCreator:支持生成 10 分钟长视频的 Agent 框架 — gekobraa · 2026-08-21
- Agent 评测陷阱:单一排名忽略 Harness 的影响 — Affectionate-File-26 · 2026-08-21
- 用 AI 搞定多机配置,类 Nix 方案实测 — samgoodwin89 · 2026-08-21