模型降价但企业AI账单飙升,架构与系统开销成核心成本

近期多位行业观察者指出,尽管底层大模型的Token单价在过去一年显著下降,但企业生产环境的AI账单不仅没有缩减,反而持续飙升。这一反常现象表明,单纯关注模型降价已无法反映真实的AI生产成本,架构与系统层面的消耗才是当前推高企业算力开支的核心因素。

已确认

复杂任务链导致 Token 消耗激增:@rohanpaulai 与 @0xJeff 等作者指出,如今一个简单的用户请求,往往会在后台触发检索增强生成(RAG)、工具调用、推理循环以及多步骤执行等复杂操作。这种架构模式导致每个任务消耗的Token数量急剧上升,其增长速度已经远超Token单价的下降速度。数据显示,入门级推理成本虽从每百万Token 18.40美元降至6.07美元,但持续运行智能体的实际成本却极其高昂,甚至能达到前者的23.4倍。

上下文层与隐性系统开销:除了任务链本身的消耗,底层的上下文层也是烧Token的大户。@rohanpaulai 提到的基准测试表明,在模型保持不变的情况下,仅替换底层的通用上下文方案就会导致巨大的Token消耗差异。此外,@arx-go 强调,生产环境中的真实AI预算远不止LLM/API调用费用,还必须包含重试与失败成本、多模型路由开销、缓存损耗以及向量嵌入和可观测性等隐性支出,这些共同构成了企业沉重的AI账单。@granvilleDSC 也认为,这种系统层面的总成本是很多企业此前未能充分预料的,它将直接决定AI在企业内部的落地与扩展速度。

为什么重要

@新智元 的报道进一步指出,企业AI的竞争焦点已不再是模型能否跑通,而是能否把算力稳定转化为可度量、可治理的“Token产线”。以Meta、亚马逊等大厂内部的Token排行与刷榜现象为例,企业内部Token使用量正急剧膨胀,如何提升Token的利用率并优化整体产线,已成为企业AI落地的新瓶颈。

2026-07-22 ~ 2026-07-24 · 7 条相关

一手来源