跳到主要内容

大模型的 Token 到底是什么?为什么按它收费

AI 服务的账单不按次数、不按字数,而按 token 结算。这篇用积木类比讲清 token 是什么、为什么输入和输出都要计费、上下文越长为什么越贵,以及企业粗估一个场景月成本的简单方法。

核心结论

Token 是大模型处理文字的最小单位,像积木块:模型读写都按块进行,每处理一块都消耗算力,所以输入和输出都按 token 计费。同样的内容,不同语言、不同模型切出来的 token 数不同,没有固定换算率。粗估某个场景的成本,用「调用频次×单次输入输出规模」即可得到量级。

文字被切分成积木块并逐块计数计费的抽象示意插画

第一次看 AI 服务账单的人,几乎都会在同一行停下来:计费单位不是次数,不是字数,也不是时长,而是一个陌生的词——token。输入多少个,输出多少个,合计多少钱。

要看懂这张账单,得先接受一个设定:大模型「看到」的文字和你看到的不一样。你看到的是一句话,它看到的是一排积木块。

模型眼里没有字,只有积木块

文字进入模型之前,会先经过一道切分工序,切出来的每一小块,就是一个 token。常见的词往往是一整块「预制件」,生僻的词会被拆成几个小块再拼起来,标点和空格也各占各的块。模型读文字是一块一块地读,写回答也是一块一块地往外拼——它不是想好一整句再说,而是每次只拼下一块,拼之前回头看一眼前面已有的块。

所以 token 不是字,也不是词,而是模型处理文字的最小单位。切块的模具是每个模型自带的分词器,不是哪本词典。

同样的意思,块数可能差不少

这套模具带来一个不太直觉的结果:同一段意思,用不同语言写、交给不同模型切,得到的 token 数量可能差别不小——就像不同厂家的积木,模具尺寸不一样,拼同一座房子用的块数就不同。所以不存在一个通用的换算率,「一个字等于几个 token」这类口诀,换个模型就不作数了。有用的是数量级直觉:一条短消息是几十到几百块的量级,一份长手册是几万到几十万块的量级。真需要精确数字时,主流模型服务都提供计数工具,让技术同事跑一下就有了。

为什么按块收费:每一块都要过一遍机器

按 token 计费不是定价花招,而是成本的真实形状。模型每处理一块,都要实打实地跑一遍计算——读进来的每一块要算,写出去的每一块也要算。所以账单分两栏,输入和输出分开计费。而且输入比你以为的大:除了你敲的那句话,还有系统提示词(平台预设的角色和规则)、你贴进去的资料,以及多轮对话的历史记录——历史每一轮都会重新发给模型一遍,对话拖得越长,这部分越厚。顺带一提,多数服务对输出块的定价高于输入块——生成比阅读更费算力。所以让模型「话少而准」,不只是风格偏好,也是实打实的省钱。

这也解释了「上下文越长越贵」:一来块数变多了;二来模型每拼一块新积木,都要回头看一遍桌上已有的块,桌面越满,每一步越费劲。上下文到底是什么、为什么还会「忘」,上下文窗口:为什么 AI 聊着聊着就「忘了」里单独讲。

给企业算一笔粗账

对企业来说,token 的意义不在概念,而在预算。粗估一个场景的月成本,只需要三个数:一次调用的输入大概多大(提示词+资料+历史)、输出大概多大、一个月调用多少次。三者相乘,再乘以单价,量级就出来了。拿客服问答举例:每次要带上几段知识库资料,输入不小;回答本身不长,输出不大;但一天几百次的频次会把总量顶上去。这笔账不必算得精确,但立项之前得有人算过。如果再配上月度用量上限和超量提醒,这笔预算就从「估计」变成了「受控」。

顺着这笔账,也能看出一个常见做法为什么不划算:把整本产品手册塞进每一次对话。手册本身就是几十万块的量级,每问一个问题都全额计费,贵;而且资料一长,模型反而容易看漏关键段落,不准。更合理的路线是检索式:每次只把和问题相关的几段找出来递给模型——这正是 RAG 做的事。

两个最常见的误会

一是把 token 当字数。合同里写「支持处理多少万字」,账单却按 token 结算,两者之间隔着分词方式、语言、格式的差异,签约前值得让技术同事把口径对齐。二是以为单价便宜就等于总成本低。总成本是单价乘用量再乘返工率:便宜的模型如果理解力弱,可能需要更长的提示词、更多轮的纠正、更多的人工返工,总账未必省。控制成本的抓手也远不止换模型,提示词瘦身、重复内容缓存、按任务难度分级用模型都有空间,展开可以看企业使用 AI 如何控制成本

决策者记两句话就够

第一句:token 是 AI 时代的水电表。你不需要亲自抄表,但要知道哪些行为费电——长资料、长对话、高频调用。第二句:立项时问一个问题——「这个场景一个月大概用多少 token,谁在盯这个数?」有人答得上来,月底的账单就不会变成惊吓。