企业使用 AI 如何控制成本:从 Token 计费到用量治理
AI 用量上来之后,账单开始变成需要管理的对象。这篇把 Token 计费翻译成人话,列出成本失控的四种常见原因,给出五个可落地的治理杠杆,并回答更根本的问题:这笔钱到底该和什么比。
核心结论
大模型按 Token 计费,可以粗略理解为按处理的文字量收费,输入和输出都算钱。企业成本失控常见于四件事:反复塞入整份长文档、所有场景都用最强模型、长对话不清理上下文、没人查看用量。治理靠五个杠杆:用量看板与预算告警、按场景分级选模型、用检索代替堆料、精简提示词与输出、高频场景做缓存;判断值不值,要和这件事原本的人工时间成本比,而不是看绝对金额。

很多企业第一次认真讨论 AI 成本,是从财务的一句提问开始的:「这笔每个月都在涨的 API 费用,到底是什么?」用的人越来越多本来是好事,但如果没人说得清钱花在了哪里、值不值,好事很快会变成预算会议上的一笔糊涂账。
这篇文章把三件事讲清楚:钱是怎么计的,通常是怎么浪费掉的,以及有哪几个杠杆能把它管起来。
Token 计费,翻译成人话
大模型服务几乎都按 Token 计费。Token 是文本的计量单位,你可以粗略理解为按处理的文字量收费——具体的换算规则在大模型的 Token 到底是什么里有展开,这里记住量级感就够了:文字越多,钱越多。
有两个点最容易被忽略。第一,输入和输出都算钱:你塞给它的资料和指令,加上它生成的回答,全部计费——所以「把整份文档丢进去」这个动作本身就是一笔支出。第二,不同模型的单价差距很大,同一个任务换个模型,成本可能差出一个数量级。也就是说,「这个场景用哪个模型」不只是效果决策,同时是成本决策。
钱是怎么悄悄花掉的
最常见的一种浪费:把整份长文档反复塞进对话。一份几十页的手册,每问一个问题都整份重发,一天问二十次,等于把这本手册的处理费付了二十遍。
第二种:所有场景都用最强的模型。给邮件打分类标签、从表单里提取字段,这类简单任务用旗舰模型,结果不会更好,钱照最贵的收。
第三种:长对话从不清理。多数对话式产品会把历史记录整体带进每一轮,聊得越久,每一句的成本越高——这和上下文窗口的机制直接相关。一个挂了几百轮的群聊机器人,后期每次回答都拖着全部历史在计费。
第四种是管理侧的:没人看用量。费用散在几个工具、几个部门的账号里,谁也说不出总数,更没人设过上限。不少团队是在额度用尽、服务停掉的那天,才第一次打开用量页面。前三种浪费能长期存在,根源都是这一种。
把成本管起来的五个杠杆
治理不等于一味省钱,而是让花钱的结构变得可解释。下面五个杠杆,按见效的先后排序。
- 建用量看板和预算告警:按部门、按场景拆开看用量,设月度预算线,超线自动提醒。这一步本身不省一分钱,却是其它所有动作的前提——看得见,才管得住。
- 按场景分级选模型:分类、打标、字段提取用轻量模型,对外发布的文稿、复杂分析才用强模型。整理一张「场景对应模型」的表,写进团队的使用规范。
- 用检索代替堆料:与其每次把整本手册塞进对话,不如建个知识库,让系统只取和问题相关的几段——这正是RAG 是什么里介绍的思路,输入量能小一个数量级,答案还能带出处。
- 给提示词和输出瘦身:删掉提示词模板里从没起过作用的说明;要结论就明确只要结论,别让模型默认写一篇小作文。输出也是钱。
- 高频场景做缓存:一样的问题被问一百遍,答案算一次就够了。客服 FAQ、政策查询这类重复度高的场景,缓存的收益最直接。

落地顺序上,建议先做看板——知道钱在哪,再动模型分级和检索——改变花钱的结构。前者是一周内能完成的事,后两者才是省得最多的地方。
值不值,别拿绝对金额判断
账单数字本身说明不了问题。判断一笔 AI 支出值不值,对比对象不是这个月花了多少,而是这件事原本的人工时间成本:一份会议纪要,AI 整理的直接费用通常远低于一个人为它花掉的半小时;一批客服问题的初步应答,对应的是一个班次的人力。算这笔账时,注意把人工复核的时间也算进 AI 一侧——生成三分钟加复核十分钟,对比的才是原来纯人工的四十分钟,结论才不会虚高。这样比下来,多数用对了场景的支出仍然便宜得出人意料。
反过来也成立:如果某个场景的 AI 费用逼近甚至超过了人工成本,那几乎一定是用法出了问题——回到上面四种浪费里逐条排查,通常能找到原因。
成本治理的终点,不是把数字压到最低,而是让每一笔用量都对应一件说得出名字、算得出价值的事。做到这一点,AI 预算就从一笔糊涂账,变成和水电一样正常的经营成本。