超市商品分类实测:GPT-5.6 准确率明显高于 5.5,置信度路由值得做吗
Expensive_Break_6163 · reddit · 2026-09-16
一位开发者分享个人项目的实测:用 GPT 对超市商品做多层级分类(水果→冷冻/新鲜/罐装等),在多批各 50 条的数据上测试 GPT-5.5(low) 与 GPT-5.6(medium),发现 5.6 的准确率明显更高。
他在考虑一个成本优化方案:让便宜的 5.5 处理大部分分类,只在置信度低时回落到 5.6,但核心疑问是模型自我报告的置信度到底可不可信——如果不可信,这种路由机制就失去意义。项目目前追求最低成本。
「编程与Agent」频道最新
- Simfinity.js 示例:将指定 GraphQL 操作一键发布为 MCP 工具 — Affectionate_Hawk971 · 2026-09-16
- GPT-6 花 367 美元烧 610 万 token,7 小时 50 分钟在游戏里造出火箭 — Angaisb_ · 2026-09-16
- DataFast 为提及监测与图表笔记新增 MCP/API 支持 — marclou · 2026-09-16
- 开源项目 Semantica 获 13k 星:图原生基础设施构建可信 AI — tom_doerr · 2026-09-16
- Reddit开发者晒自研个人助理:无会话连续记忆,用户依赖3个月 — matteoianni · 2026-09-16
- 开发者让 NoSpoon 智能体全自动创作短剧,月底将转内部工具 — Kyrannio · 2026-09-16