跳到主要内容

大模型持续降价,企业该高兴还是该冷静?

2024 年 5 月,大模型输入价进入「厘时代」;2025 年 1 月,o1 级推理能力标价 16 元/百万 tokens。降价一轮接一轮,企业是不是可以放开用了?这篇把降价的来龙去脉理清楚,再说清账单里真正该盯的地方。

核心结论

该高兴,也该冷静。高兴的是:2024 年 5 月 21 日阿里云把 Qwen-Long 输入价降 97% 至 0.0005 元/千 tokens,2025 年 1 月 DeepSeek-R1 又把 o1 级推理的输出价定在 16 元/百万 tokens——试错成本已经极低,长文档、批量内容等原本不划算的场景变得可行。冷静的是:降价主要来自技术效率而非补贴,token 单价只是账单一角,用量失控、贵模型干便宜活会把省下的钱吃掉;真正的成本大头正从 API 转向数据、流程与人。

持续下行的价格曲线与企业成本账单并置的抽象插画,象征大模型降价与用量治理

2024 年 5 月 21 日,阿里云宣布 9 款大模型降价,其中主力模型 Qwen-Long 的输入价从 0.02 元/千 tokens 降到 0.0005 元/千 tokens,降幅 97%;输出价降 90%,到 0.002 元/千 tokens。媒体给这轮价格起了个说法:大模型定价进入「厘时代」。同一个月,字节跳动的大模型也宣布降价。作为参照,当时 GPT-4 的输入价约 0.22 元/千 tokens,百度 Ernie-4.0 约 0.12 元/千 tokens。

价格战没有停在 2024 年。2025 年 1 月,DeepSeek-R1 发布,把对标 OpenAI o1 的推理能力标价在输出 16 元/百万 tokens,输入缓存命中时 1 元/百万 tokens。到今天(2026 年初),「大模型太贵」已经很少被当作不上 AI 的理由。真正的问题变成:单价一路下行,企业该高兴,还是该冷静?我们的回答是:都该——但要分清各自的理由。

降价从哪来:主要不是补贴,是效率

判断低价能不能持续,要先看它从哪来。这一轮降价背后主要是四件事。一是架构效率:MoE(混合专家)架构让模型每次推理只激活一小部分参数——DeepSeek-R1 总参数 671B,每次实际激活约 37B,算力消耗和参数规模脱了钩。二是推理优化:同样的硬件能服务更多请求。三是计费设计:「缓存命中 1 元、未命中 4 元」这样的定价,把重复内容的处理成本明码标了出来。四是竞争:开源模型把能力的底价压下来,闭源厂商必须回答「贵在哪」。合在一起看,这不是烧钱换市场的临时补贴,而是成本结构的真实下降——低价大概率是常态,不是窗口期

该高兴的部分:试错成本低到可以忽略

单价下行最实在的红利,是「试一试」不再需要立项。粗略按一个汉字一个 token 估算,一份 50 万字的资料,用降价后的 Qwen-Long 输入价读一遍,成本大约两毛五;按降价前 0.02 元/千 tokens 的旧价要 10 元上下,按当时 GPT-4 的输入价则要一百多元。原来算不过账的场景——批量长文档处理、全量历史工单分析、内容素材的多版本生成——现在都进入了「先跑一遍看效果」的成本区间。对预算有限的中小企业,这是真实的门槛下降;如果对 token 计费还没有直觉,可以先补一课大模型的 Token 到底是什么

该冷静的部分:单价只是账单的一角

冷静的理由同样具体。第一,用量会膨胀:单价降 97%,调用量翻上几十倍,账单反而变大——便宜会鼓励「什么都丢给模型」,多数浪费恰恰从这里开始。第二,贵模型干便宜活:推理模型是为复杂任务准备的,拿它跑格式转换、简单分类,等于用挖掘机绣花;不做分级的团队,很容易把高价推理花在不需要推理的活上。第三,重复传长上下文:每次请求都把整份资料重新发一遍,缓存优惠一分吃不到,费用全按未命中计。三件事叠加,降价省下的钱很快被吃掉——治理方法在企业使用 AI 如何控制成本里有一套完整做法。

便宜的是单价,总成本取决于用量治理。

更大的变化:成本大头从 API 移向人和流程

把镜头拉远,这轮降价真正改变的是企业 AI 项目的成本结构。token 账单在总投入里的占比越来越小,三样东西的占比越来越大:数据整理——资料不成形,模型再便宜也读不出结果;验收与复核——AI 产出要有人把关,这是持续的人力投入;运营——提示词维护、流程调整、员工培训。这解释了一个反直觉的现象:模型降价 97%,AI 项目的总预算并不会跟着降 97%,钱只是从模型侧移到了人与流程侧。预算怎么排,应该跟着这个结构走,而不是跟着单价走。

给企业的三个动作

  • 按场景分级用模型:简单任务用低价档,复杂推理才上高价档,涉敏数据考虑私有部署;开源模型给了足够的选择空间,背景可以看DeepSeek 之后:开源模型对企业 AI 成本意味着什么;
  • 建立用量看板:按业务线、按场景看 token 消耗和单任务成本,每月例行过一遍,让「账单为什么涨」永远有答案;
  • 把便宜当成多试的理由,而不是乱用的理由:低单价的正确用法,是低成本地验证更多场景——验证完,留下算得过账的,关掉算不过账的。

回到标题那个问题

该高兴还是该冷静?该高兴,因为进入的门槛真实地消失了;该冷静,因为省钱从来不会自动发生。单价下降交到企业手里的,不是一张打折卡,而是一个更大的试验空间——用得有章法,它是红利;用得没章法,它只是把浪费的单价也一起打了折。

资料来源

  1. 科创板日报:阿里云宣布通义千问主力模型大幅降价(2024-05-21)
  2. DeepSeek:DeepSeek-R1 发布及定价(2025-01-20)