5 个决策模型实测千笔真实财务数据分类,强制二选一反而更准
purealgo · reddit · 2026-10-03
作者用 1000 笔真实交易(每笔跑 3 次)横评了 5 个决策模型(Jev、D1、Solar Decide、Kev 4b、Span-01)在财务/税务分类上的表现:
- 模糊的餐厅名会让模型信心崩溃,倾向弃权(abstain);
- Span-01 无法弃权且只能回答 yes/no,得分因此明显偏低;
- 反直觉的是:当 Jev 被强制只答 yes/no 时,成绩反而超过它允许弃权时的初始表现,也超过 Span-01;
- 所有税务类目里,银行转账的分类成绩最差;Span-01 在慈善类交易上完全答不对。
测试通过作者自建的系统 one MCP 完成,并开源了连接器,可把决策模型快速接入 Claude Code、Codex 和 pi。
「编程与Agent」频道最新
- Cloudflare Agents SDK 一等支持 Pi,长时运行 Agent 可扛崩溃重启 — irvinebroque · 2026-10-03
- 从写代码到审代码之后:下一步是审「审代码的过程」 — ykdojo · 2026-10-03
- Spring AI 2.1.0-M1 发布:引入 MessagePart 模型并支持 OpenAI Responses API — therealdanvega · 2026-10-03
- O'Reilly 撰文:决策记录(ADR)是编码 Agent 缺失的项目记忆 — rseroter · 2026-10-03
- xAI 发布实验性 TypeScript SDK,统一文本语音图像视频接口 — mattyp · 2026-10-03
- 开发者谈 AI 编码工具好坏的分水岭:pass@1 一次成功率 — madhavsinghal_ · 2026-10-03