LLM API 定价到底是怎么回事
几乎每一篇 AI API 费用对比,每个模型只报一个数字,而那个数字几乎总是输入价。它是供应商公示的四个数字里最没用的一个。一个模型按几个独立的计价表收费:你发进去的 token、它写回来的 token、从缓存读取的 token,以及(在部分供应商那里)写入缓存的 token。每个计价表都有自己的费率,而这些费率彼此差得远。
一个 token 大约是四分之三个英文单词,所以一百万 token 大概接近 750,000 个词。价格按每百万 token 报,是因为单条消息便宜到,若按条报价将全是零。这种表述掩盖了在真实对话里计价表叠加得有多快:每一轮都会把之前说过的一切重新发一遍。
下面这张表列出了几个模型的全部四个计价表,取自驱动本站模型选择器和费用计算器的同一份 metadata feed。注意输入那一列能告诉你的有多少:两个输入价相同的模型,在输出上可以相差三倍,而输出才是波动最大的那个计价表。
- 输入(Input):你发出去的一切,你的消息、到目前为止的对话、任何 system prompt、任何附带的文本。
- 输出(Output):模型写回来的一切,包括会产出推理 token 的模型上的那些推理 token。
- 缓存输入读取(Cached input read):供应商已经见过的重复上下文,按远低于新鲜输入的费率计费。
- 缓存写入(Cache write):部分供应商为把那段上下文放进缓存本身所收的费。
| 模型 | 输入(USD / 1M tokens) | 输出(USD / 1M tokens) | 缓存输入读取 | 缓存写入 |
|---|---|---|---|---|
| Claude Haiku 4.5 | 1.00 | 5.00 | 0.10 | 1.25 |
| Claude Sonnet 5 | 2.00 | 10.00 | 0.20 | 2.50 |
| GPT-5.6 Luna | 1.00 | 6.00 | 0.10 | 1.25 |
| GPT-5.6 Terra | 2.50 | 15.00 | 0.25 | 3.125 |
| Kimi k2.5 | 0.60 | 3.00 | 0.10 | 0.60 |
| Qwen3.7 Plus | 0.50 | 3.00 | 0.05 | 0.625 |
| MiniMax-M2.5 | 0.30 | 1.20 | 0.03 | 0.375 |
输出 token 才是贵的那一半
LLM 定价里最可靠的规律,就是写比读贵。为了给它一个数字而不是一个印象,我们取了 Oriveo metadata feed 里每一个公示了单 token 价格的文本模型(覆盖全部 15 家供应商),把每个模型的输出费率和它自己的输入费率作比较,数据截至 2026 年 7 月 24 日。
中位数的模型,输出的收费正好是输入的四倍。大约每十个模型里有一个对两者同价、或输出更便宜,这在由推理托管方提供的开放权重模型里很典型。在另一端,大约每七个里有一个的收费高于六倍,而 feed 里差距最大的达到十二倍。
这对你怎么花钱有直接影响。裁剪 prompt 是所有人第一个伸手去够的优化,而它通常是较小的那根杠杆。要求更短的答案、给输出长度设上限,或选一个不会长篇大论地「想出声」的模型,比从问题里砍掉一段更能拉动账单。推理型模型在这里值得再看一眼,因为它们生成的思考 token 即便你从没看到,也按输出计费。
| 输出价相对输入价 | 在有定价的文本模型中的占比 |
|---|---|
| 相同或更便宜(1× 或更低) | 10% |
| 1× 到 2× | 11% |
| 2× 到 4× | 39% |
| 4× 到 6× | 25% |
| 高于 6× | 15% |
真正推高你账单的是什么
人们第一次收到 API 账单时会吃惊,通常出于四个原因之一,而没有一个是模型那个「头条价」。下面这些机制对每一家供应商都成立,因为它们源自聊天 API 的工作方式,而非任何厂商的政策。
最大的那个是上下文重发。一次 API 调用是无状态的:模型对你上一轮没有记忆,所以客户端必须在每条消息里把整段对话重新发一遍。一条跑了四十轮的线索,在第四十一轮会把四十轮历史当作输入发出去。因此一段对话的成本大致随其长度的平方增长,这也是为什么一条长线索可能比二十条覆盖同样内容的短线索还贵。
Prompt caching 是那个抵消力量,值得在你把它一笔带过之前先弄懂。支持它的供应商,会让重复的上下文按缓存读取而非新鲜输入计费。在我们测的这份 feed 里,大约每五个模型有一个公示了缓存读取价,而在有它的地方,缓存费率的中位数落在该模型自身输入价的 10%:我们找到的最低不到 1%,最高约 58%。有些供应商还会为写入缓存收费,通常比正常输入高一档,所以缓存在同一段上下文被复用好几次时才划算,用一次则不然。
- 对话历史:每一轮都完整重发,所以长线索的花费不成比例地更多。
- System prompt 与预设:可复用的指令会被前置到每一条消息,悄悄把它们的 token 数翻倍。
- 附件:丢进聊天里的一份文档或一张图会变成输入 token,并且在该线索之后的每一轮里都留在上下文中。
- 推理 token:在会生成它们的模型上按输出计费,无论推理是否被展示出来。
- 重试与重新生成:一次重新生成的答案是第二次完整计费的请求,而不是一次免费的更正。
15 家供应商的价格版图
下面这张表是 Oriveo 接入的 15 家供应商各自公示输入价区间的一个快照。它只计入公示了单 token 价格的文本模型,并给出该供应商这类模型里最便宜和最贵的两个。它是一张「各供应商落在哪」的地图,而不是推荐:一家供应商最便宜的模型和最贵的模型,彼此很少能互相替代。
来源与方法,方便你核对:每一个数字都来自 Oriveo 生产环境的 metadata feed,位于 api.oriveoai.com/api/metadata,contract version 47,生成于 2026-07-24T01:00:09Z,正是应用用来为消息定价、以及本站费用计算器背后所用的同一份 feed。价格以美元每百万 token 计,数据截至 2026 年 7 月 24 日。图像生成模型,以及供应商按请求而非按 token 定价的模型,均已排除,因为对它们来说一个单 token 数字毫无意义。
有两件事很突出。第一是跨度:截至 2026 年 7 月 24 日,整份 feed 里最便宜的输入价是每百万 token $0.01,最贵的是 $150,同一个选择器里两行之间相差一万五千倍。第二是目录的广度和便宜是两条不同的轴:聚合器承载最宽的区间,因为它们转售很多家供应商,而单一供应商则紧紧聚在自家的分层价位附近。
把这里的每一个数字都当作易腐品。供应商不断重新定价、推出更便宜的档位、下线模型;下表里就有好几行在过去一个季度内变过。任何援引模型价格的文章都是一张照片,这也正是那份实时 feed 和计算器存在的理由,也是本页写明抓取日期、而非暗示这些数字永久有效的原因。
| 供应商 | 有公示 token 价的文本模型数 | 最低输入(USD / 1M) | 最高输入(USD / 1M) |
|---|---|---|---|
| OpenAI | 49 | 0.05 | 150 |
| Anthropic (Claude) | 10 | 1.00 | 15 |
| Google Gemini | 21 | 0.075 | 2.00 |
| xAI Grok | 6 | 1.00 | 2.00 |
| DeepSeek | 4 | 0.14 | 0.435 |
| Mistral | 32 | 0.04 | 2.00 |
| Qwen | 49 | 0.035 | 2.80 |
| Kimi | 9 | 0.20 | 2.00 |
| MiniMax | 7 | 0.30 | 0.60 |
| Z.ai | 12 | 0.07 | 1.40 |
| Groq | 7 | 0.03 | 0.59 |
| Together AI | 69 | 0.02 | 3.50 |
| Fireworks AI | 15 | 0.07 | 2.80 |
| OpenRouter | 305 | 0.01 | 150 |
| SiliconFlow | 49 | 0.04 | 1.74 |
同一个模型为什么会有不止一个价
打开两份模型目录,你会发现同一个模型被标了不同的费率。这通常不是错误。开放权重模型由好几家推理托管方提供,各自有自己的硬件、吞吐和利润,所以一个模型在一家托管上的价格和另一家上确实可以不同。在上面那份 feed 里,同一个开放权重系列就以真正不同的费率出现在好几家供应商那里。
第二个原因是你经由哪一层购买。聚合器处在你和底层供应商之间,得靠某种方式为这个位置买单:通过 token 价上的价差、一笔充值费、按请求的百分比,或一套 credit 体系(它和 token 的换算由平台而非供应商价目表定义)。这些机制本身没有一个是坏的;关键在于机制是否公开。举例来说,截至 2026 年 7 月 24 日,OpenRouter 公示的政策是银行卡充值收 5.5% 的费用、最低 $0.80,而对你自带的 key,每月前一百万次请求不收费,超出部分按模型正常价的 5% 以 credits 扣除。
你在比较平台时值得问的问题,不是「一个 credit 多少钱」,而是「从供应商 list 价到我被收的费,那条公示的换算路径是什么」。如果一个平台以 credits 计价,又不公布那个换算,那你在做的比较就不是和模型的价格比,而是和平台的定价政策比,而那套政策可以在模型价格分毫未动的情况下就改变。
订阅还是按量付费:对你来说哪个更便宜
这是大多数人真正带着来的问题,而它没有一个通用答案。一份固定月费订阅和按量计费的 API 访问,会在某个用量处交叉,而那个交叉点取决于你自己的消息:多长、答案多长、你选哪个模型、你的线索跑多久。任何不看你的数字就报一个省钱百分比的人,都是在猜。
你大约五分钟就能算出来,算术并不难。取一个真正典型的一周,而不是你最忙的那一周。数一数消息条数。以词为单位估一下你拿到的答案的平均长度,再乘以大约 1.35 得到 token 数。加上输入那一侧,记得每一轮都会把到目前为止的线索重发一遍。乘以模型公示的输入和输出费率,再和你在考虑的月费作比较。本站的费用计算器会对着实时价格帮你做这件事,这样你就不必自己维护那些费率。
有几个结构性规律稳定到可以在不编造数字的前提下直说。用量轻或忽高忽低时、偶尔用好几个模型而不是重度用一个时、以及大部分工作是短问短答时,按量访问往往胜出。日常用量持续很高时,订阅往往胜出,而且它有一个真实的非财务优势:一份可预期的账单。看不到逐条消息费用的按量访问,是两头不讨好的最差情形,而这恰恰是「每条消息一个费用估算」意在防止的失败模式。
怎样真正减少你的花费
一旦你能看到这些计价表,大部分节省来自少数几个习惯,而不是去搜最便宜的供应商。按对一个典型聊天工作负载拉动数字幅度的大致顺序排列:
通常不管用的,是把一切都切到目录里最便宜的模型。一个要试三次才把答案答对、价格却只有五分之一的模型,不是节省,而且还搭上你的时间。这条建议有用的版本,是让模型与任务相配:便宜模型做抽取、格式化、摘要和翻译,贵模型做那些你本来会付钱请人来干的活。
- 为新话题另起一段新对话。这是最大的单根杠杆,因为它让你不再为重发一段无关历史而付费。
- 想要更短的答案时就明说要更短的答案。在大约每十个模型里的九个上,输出都是更贵的那个计价表。
- 让模型与任务相配,而不是遇事就默认掏出最强的那个。
- 把 system prompt 和可复用预设保持精简:每一条用到它们的消息都会为它们计费。
- 在供应商支持、且你反复复用同一段长上下文时,使用 prompt caching。
- 用完就把附件从线索里移除,而不是让它们随之后每一轮一路带下去。
- 在把某个模式重复一百遍之前,先看一眼那条消息上的估算。
Oriveo 怎么把费用给你看
Oriveo 里的每条消息都带一个费用估算,在答案结束的那一刻,按供应商公示的 token 定价和实际上报的 token 算出来。这个估算在每一层都有,包括免登录那层,因为一个只有付费方案才看得到的费用,帮不了你决定要不要为任何东西付费。上面那些表里用到的同一份 metadata feed,正是提供这些价格的来源,这也是应用不需要你去维护一份价目表的原因。
它是一个估算,而且被明确标注为估算。供应商会套用各自的取整、最小可计费单位、按账户的费率以及偶尔的促销价,而 token 数是由供应商事后上报的。这个估算存在的意义是在一个月里为决策把方向;供应商的账单才是最终依据,两者不一致时以账单为准。
更深入的分析在付费方案之后。Usage Insights(按供应商和模型拆分的花费、月度趋势和预算提醒)属于 Pro 与 Lifetime;截至 2026 年 7 月 24 日,价格为月付 $9.99、年付 $59.99 或一次性付费 $149.99。这些方案买的只是软件功能:它们不含任何 AI 用量、不含模型 credits、不含供应商订阅,所以应用的价格和你 token 的价格,永远不会被捆成一个你拆不开的数字。

这些数字告诉不了你的事
一张价格表是起点,不是决定。有三件它没写进去的事值得明说,因为它们经常会把一个仅凭价格看似已定的比较翻转过来。
第一是每个任务用掉的 token 数。两个同费率的模型,在抵达同一个答案时花掉的 token 数可以相差很大,而一个啰嗦的便宜模型,每完成一件活的花费可能比一个惜字如金的贵模型还高。第二是重试率:一个你不得不重新生成的答案会被计费两次。第三是 token 计价表之外的一切:速率限制、延迟、上下文窗口、在你所在地区的可用性,以及模型能不能读你工作用的那些文件格式。
诚实地使用像本文这样的比较,是把它当作一层入围筛选。排掉那些明显超出你预算的行,拿两三个候选放到你自己的真实工作上试,然后看一件完成的活花多少,而不是看一百万 token 花多少。逐条消息的估算之所以存在,正是为了让这个实验只花一天、而不是一个计费周期。