超市商品分类实测:GPT-5.6 准确率明显高于 5.5,置信度路由值得做吗

Expensive_Break_6163 · reddit · 2026-09-16

一位开发者分享个人项目的实测:用 GPT 对超市商品做多层级分类(水果→冷冻/新鲜/罐装等),在多批各 50 条的数据上测试 GPT-5.5(low) 与 GPT-5.6(medium),发现 5.6 的准确率明显更高。

他在考虑一个成本优化方案:让便宜的 5.5 处理大部分分类,只在置信度低时回落到 5.6,但核心疑问是模型自我报告的置信度到底可不可信——如果不可信,这种路由机制就失去意义。项目目前追求最低成本。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →