实践者吐槽:模型可验证任务变强,但领域可靠性仍是硬伤

JayKurtz90 · x · 2026-09-14

一位横跨研究、写作、销售与知识工程的一线用户长文指出:模型在可验证任务上进步明显,但在动态环境中的领域专用可靠性不足。他举例:销售情报平台号称能定位真正影响成交的因素,实测准确率只有约 5%;让模型产出"为我定制"、能预判后续问题的研究输出,Astra 这类产品也无法自动做到。他承认这类定制工作流非常有价值,但搭建难度极高,并花了一整天重建自己的全球"业务……"工作流第一版,同时呼吁作者开设相关 lab/课程。

所属事件:实践者称模型可验证任务变强但领域可靠性仍是短板(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →