多数技术团队在评估大模型成本时,第一反应是看 Token 单价。GPT-4 比 GPT-3.5 贵多少、国产模型有没有折扣、长上下文是否加价——这些当然重要。但过去一年里,我接触过十几家把 LLM 接入生产环境的中型企业,发现一个共同规律:真正让月度账单失控的,往往不是模型费率,而是大量根本没必要的“无效调用”。换句话说,你用半价拿到了 Token,却多花了三倍的调用量。
企业内部知识库或客服场景里,用户高频问题高度集中。以一家做跨境电商的公司为例,他们的 AI 客服每天接待约八千轮对话,其中“查物流”意图占了 35%。由于早期架构没有做查询去重,同一用户在半小时内多次点击“查询物流”,系统每次都走完整的大模型推理链路。按 GPT-4 Turbo 的输入价格计算,八千轮里约有 2800 轮是重复意图,每轮平均消耗 3000 Token,仅此一项每天就多烧 33.6 美元,一年超过 1.2 万美元。更隐蔽的是内部工具:分析师反复用自然语言问同一个数据口径,后台每次都重新生成 SQL。这类重复提问在日志里很难一眼识别,却像漏水的水龙头,把预算一点点放空。
RAG(检索增强生成)架构盛行后,很多团队为了防止“漏掉信息”,习惯把检索回来的 Top-10 文档全塞进 Prompt。一家 SaaS 公司给我看过他们的调用日志:平均每次请求携带 8200 Token 的上下文,其中约 60% 是相关性不足 0.5 的弱相关段落。他们用的是 128K 上下文窗口的旗舰模型,输入单价随长度线性累积。简单测算一下,如果通过重排序只保留 Top-3 文档,平均 Token 数可以压到 3200,单次调用成本直接腰斩。Prompt 不是越厚越安全,每一字节无关文本都在悄悄抽成。
大模型没有记忆,除非你给它造一个。很多系统把大模型当成无状态计算器,相同的问题、相同的上下文、甚至相同的系统 Prompt,每次都要完整推理。还是前面那家装客服的公司,他们在接入语义缓存后,把常见问题的缓存命中率做到了 42%。这意味着近一半的请求无需再走模型,直接返回缓存结果。以日均 2 万 Token 消耗、GPT-4 级别的单价估算,命中率每提升 10%,月度成本就能下降约 8% 到 12%。缓存的搭建成本不过几天开发时间,回报周期以周计算。
不是所有任务都需要最强的脑子。我见过最极端的案例:一家金融公司用 GPT-4 做意图分类,把用户的一句话分到 12 个业务标签里。这个任务输入短、输出固定、对创意毫无要求,用 GPT-3.5 Turbo 的准确率就已经达到 97%,而 GPT-4 只提升到 98.5%,成本却相差近 20 倍。他们每天产生 50 万次此类分类调用,单月为此多付超过 3 万美元。合理的做法是建立模型路由:简单分类走轻量模型,复杂推理和创作再走旗舰模型。分层后,通常 70% 的请求可以落在低成本层。
Agent 架构让大模型可以自主调用工具、观察结果、再决策下一步。但缺乏刹车的 Agent,很容易陷入“调用—失败—重试—再失败”的循环。一家做数据分析 Agent 的团队曾遇到这样的场景:模型需要调用内部 API 获取季度销售数据,由于 API 临时变更了字段名,Agent 连续 47 次尝试不同参数组合,每次平均消耗 2500 Token,单次用户请求最终烧掉了 11.75 万 Token。如果按 GPT-4 的费率,这一个失败案例就值 3.5 美元。没有设置最大迭代次数和单次任务 Token 上限的 Agent,等于把信用卡交给了可能犯错的实习生。
网络超时或模型偶发报错时,很多系统的默认策略是立即重试,甚至并发重试。这在高峰期尤其致命:上游流量本就饱和,重试导致 QPS 翻倍,失败的请求变成双份、三份计费。一家在线教育平台在直播高峰期遇到过这种情况:某个依赖 LLM 的实时字幕校验服务出现 5% 的超时,客户端设置了 3 次无间隔重试,结果超时率被重试流量进一步推高到 18%,当月的 LLM 账单比平常多了 40%。正确的做法是引入指数退避(Exponential Backoff),并对非关键链路做快速降级,而不是无限重试。
堵住这些黑洞,不需要颠覆性技术,但需要明确的指标和纪律。以下是我建议团队在前两个季度内落地的量化目标:
第一,建立语义缓存,把高频问题的缓存命中率目标定在 35% 以上,并每月审视 Top-20 的未命中查询,补录或优化缓存策略。第二,Prompt 必须做动态截断:根据相关性分数,只保留 Top-K 文档,硬上限不超过 4000 Token;超出部分交给二次检索或摘要模型。第三,强制推行模型路由,至少划分“轻量/标准/旗舰”三层,确保 60% 以上的请求落在轻量或标准层,只有明确标记的复杂任务才能穿透到旗舰模型。第四,Agent 必须配置预算熔断机制:单次任务的最大迭代次数不超过 10 轮,累计 Token 消耗超过设定阈值(例如 2 万 Token)即强制终止并返回人工介入提示。第五,重试策略统一为“最多 2 次,间隔 1 秒和 3 秒”,非核心链路允许直接返回兜底文案,避免重试风暴。
大模型时代,成本优化的核心已经从“买更便宜的算力”转向了“减少不必要的调用”。当你能把无效调用压下去 30%,相当于在谈判桌上多拿到了三成的折扣,而且立竿见影。建议技术负责人在下个月度 review 时,不要只盯着 Token 单价,而是打开调用日志,数一数有多少次查询本不该发生。那个数字,可能比模型报价单更触目惊心。