很多技术团队接入大模型做智能客服时,第一反应是选最强模型。毕竟客服直接影响用户体验,宁可多花钱也要保证回答质量。但这个“多花钱”到底是多少,很少有人细算。我们拿一个具体的 SaaS 客服场景来拆解:用户进线时,系统需要把对话历史、产品知识库和当前问题一起送进模型,平均每次输入 3,000 tokens;模型返回答案大约 500 tokens。就这么一个简单的问答单元,在不同模型上的价差能有多大?
为了有真实感,我直接采用当前主流云平台上公开可查的定价,按美元计算,再换算成人民币(按 1:7.2 计)。我们将模型分为 Lite、Flash、中端、旗舰四档,它们的输入与输出单价(每百万 tokens)分别如下。
Lite 档(如 GPT-4o-mini 级别)输入 $0.15、输出 $0.6;Flash 档(轻量高速模型)输入 $0.5、输出 $1.5;中端档(如 GPT-4o、Claude Sonnet 级别)输入 $3、输出 $9;旗舰档(如 Claude 3 Opus、GPT-4 Turbo 级别)输入 $15、输出 $75。
按单次 3,000 tokens 输入、500 tokens 输出计算,单次成本分别为:Lite 约 $0.00075(0.0054 元),Flash 约 $0.00225(0.0162 元),中端约 $0.0135(0.0972 元),旗舰约 $0.0825(0.594 元)。
如果只有 1,000 次会话,四档模型的成本分别是 5.4 元、16.2 元、97.2 元和 594 元。差距已经很明显,但还没到让人肉疼的程度。真正的分水岭在规模化之后:当客服量达到每月 10 万次会话时,Lite 的总成本只有 540 元,Flash 是 1,620 元,中端跃升到 9,720 元,旗舰则高达 59,400 元。
也就是说,全部用旗舰模型处理客服,每月单模型调用成本就要近六万元人民币;而 Lite 档不到六百元。这还没算因模型响应时间长带来的并发服务器开销。
看到上面的数字,有人可能会说:那干脆全用 Lite 模型算了。但做客服的工程团队都知道,查订单状态、改密码这类简单问题 Lite 能搞定,可涉及售后纠纷、多轮逻辑推理或高客诉风险场景,旗舰模型的理解力和稳定性确实不可替代。
关键在于:一个典型的客服流量池里,简单问题通常占 70% 到 80%,中等复杂度占 15% 到 20%,真正需要顶级模型处理的复杂个案往往不到 5%。模型路由(Model Routing)的核心价值就在这儿——不是一刀切,而是把流量分到对的管道。
假设一个中等体量的电商平台每月 10 万次客服会话,采用如下路由策略:80% 常规查询走 Lite 模型;15% 需要一定推理的走中端模型;剩下 5% 的高难工单走旗舰模型。月度成本如下:Lite 部分 80,000 次 × 0.0054 元 = 432 元;中端部分 15,000 次 × 0.0972 元 = 1,458 元;旗舰部分 5,000 次 × 0.594 元 = 2,970 元。路由方案总成本约 4,860 元。
如果这 10 万次全部盲选中端模型,成本是 9,720 元;如果全部走旗舰,则是 59,400 元。路由策略每月直接省下了 4,860 元(对比全中端)或 54,540 元(对比全旗舰)。在一个客单价不算高的业务里,这几乎决定了客服智能化项目是能盈利还是纯烧钱。
要实现这样的成本结构,不需要一开始就做完美的意图识别大模型。很多团队的做法是先基于规则或一个极轻量的分类模型,把“查物流”“开发票”这类意图明确的问题直接路由到 Lite 模型;只有当关键词命中售后、投诉、退款纠纷时,才升档到中端或旗舰。这个分类器本身的调用成本几乎可以忽略不计,却能让整体账单下降一个数量级。
更值得算的长期账是:当你把旗舰模型从“通才”变成“专家”,只处理那 5% 的疑难案件时,你反而可以给它更长的上下文、更复杂的提示词,甚至做 few-shot 示例,而不必担心账单爆炸。真正昂贵的不是用好模型,而是在不该用的地方用它。
做技术选型时,先别急着讨论哪个模型更聪明。把 10 万次会话的账算清楚,再决定让哪个模型回答哪类问题,这才是工程化落地该有的第一步。