AI 模型的竞争,正在从训练能力转向推理成本

AI 模型的竞争,正在从训练能力转向推理成本

过去两年,AI 模型的竞争叙事几乎被训练规模垄断:谁拥有更多 GPU、谁堆出了更大参数、谁在 MMLU 或 HumanEval 上多拿了两个百分点,谁就能占据头条。到了 2024 年,局面已经明显不同。GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro 以及开源阵营的 Llama 3.1、Qwen2、DeepSeek-V2 在主流评测榜单上的差距正在收敛。企业在实际选型时跑过 A/B 测试后发现,这些模型处理常规文本生成、代码补全或 RAG 问答时,输出质量差异往往小于 5%,但调用成本却能差出三到五倍,延迟差距更是从 200 毫秒到 3 秒不等。竞争的主战场,正不可避免地滑向推理侧。

企业采购的算盘:账单比评分更重要

一家国内做智能客服的 SaaS 厂商给我算过一笔账:他们每月要处理约 2 亿次对话检索与生成,如果全部调用主流云平台的 GPT-4 级 API,按输入输出 token 均价折算,月成本接近 90 万元人民币。切换到经过蒸馏的 70B 级别开源模型,并配合自托管推理集群与提示缓存(Prompt Caching)后,同一业务量成本压到了 14 万元以下。这还不是极限——通过 FP8 量化、Continuous Batching 和 KV Cache 压缩,他们进一步把单卡吞吐量提升了 4 倍,边际成本再次腰斩。最终,他们将 AI 功能的毛利率从负值拉回了 60% 以上。

这不是孤例。当模型能力跨过”可用”阈值后,B 端客户的决策函数里,延迟、并发与单 token 成本权重迅速上升。一个需要嵌入在线文档编辑器的 AI 功能,首 token 延迟超过 800 毫秒就会带来明显的用户流失;一个日均调用量上亿次的广告推荐系统,每百万 token 贵 0.5 美元,年底就是数百万美元的利润差。某头部云厂商的实测数据显示,在同一批 A100 集群上跑 Llama-3-70B,从 FP16 转向 FP8 量化并启用 Continuous Batching 后,单卡支持的并发请求数从 8 条提升到 40 条以上,TCO(总拥有成本)下降近 70%。训练能力是入场券,推理经济账才是规模化落地的门禁。

技术细节重新成为竞争壁垒

推理成本的压缩并非简单”买更便宜的卡”,而是系统工程。DeepSeek-V2 采用的 MLA(Multi-head Latent Attention)架构,通过低秩键值联合压缩,把 KV Cache 体积缩减到传统 Multi-Head Attention 的不到 7%,意味着同样 80GB 显存的 H100 可以承载 128K 长上下文下的更高并发,而不必频繁回退到 CPU 内存。OpenAI 与 Anthropic 相继推出的提示缓存折扣,本质上是在鼓励用户重复利用已计算的 attention 状态,长对话场景下缓存命中率如果从 0 提升到 80%,账单可以直接减少 40% 以上。这些优化不改变模型权重,却直接重塑了商业模型的单位经济。

在引擎层,vLLM 提出的 PagedAttention 把显存管理粒度从”模型权重+KV Cache 静态分配”变成动态分页,让 GPU 空置率大幅下降;而 Groq 的 LPU 架构则走专用芯片路线,在某些 Llama 模型上实现了每秒超过 700 token 的输出速度。对于需要实时交互的企业场景,比如金融领域的研报解读或代码 IDE 的自动补全,这种速度差异直接决定了产品是否可用。这些技术并不改变模型在训练阶段的参数,却直接决定了企业客户愿意为哪位供应商签下年度框架合同。

推理护城河为何比训练更坚固

训练侧的能力正在快速”民主化”。Llama、Qwen、DeepSeek 等高性能开源模型让预训练技术不再是少数巨头的黑箱,配合充足算力,中等体量的团队也能训出 70B 甚至 400B 级别的基座模型。但高效推理 infra 的 know-how 却难以复制——它涉及定制 CUDA Kernel、通信拓扑优化、弹性扩缩容策略、以及与具体业务负载匹配的量化方案。拥有这些能力的团队,可以把 Llama-3.1-70B 的每美元产出 token 数做到竞争对手的两倍。

更重要的是,训练是一次性资本支出(CapEx),推理是持续性运营支出(OpEx)。对于日活千万级的应用,推理成本每季度都在重复发生,任何 20% 的效率优势都会被时间复利放大。未来 12 到 18 个月,随着长上下文(1M+ tokens)和 Agent 多轮调用成为标配,单次请求背后的 token 消耗量将呈数量级增长,推理侧的缓存效率、吞吐量与弹性调度将比训练阶段的 FLOPs 数字更能区分赢家与输家。AI 竞赛的下半场,不在实验室的 loss 曲线里,而在数据中心每张 GPU 的每美元 token 产出上。

返回到行业好文 | | 作者:爆老师 Boson 发表于 09/23/2026

『查看更多与(AI 模型的竞争,正在从训练能力转向推理成本)相似文章』