Oriveo
全部文章LLM API 定价

AI API 费用对比:LLM 定价到底怎么算

LLM API 定价究竟由哪些部分构成、什么在推高你的账单,以及 15 家供应商真实的输入与输出价区间,数据实测于 2026 年 7 月 24 日。

  • LLM API 按最多四个独立的计价表收费,而大多数价格对比只看其中一个。
  • 输出 token 的价格中位数是输入 token 的四倍,最高可达十二倍。
  • 截至 2026 年 7 月 24 日,15 家供应商公示的输入价从每百万 token $0.01 到 $150 不等。

LLM API 定价到底是怎么回事

几乎每一篇 AI API 费用对比,每个模型只报一个数字,而那个数字几乎总是输入价。它是供应商公示的四个数字里最没用的一个。一个模型按几个独立的计价表收费:你发进去的 token、它写回来的 token、从缓存读取的 token,以及(在部分供应商那里)写入缓存的 token。每个计价表都有自己的费率,而这些费率彼此差得远。

一个 token 大约是四分之三个英文单词,所以一百万 token 大概接近 750,000 个词。价格按每百万 token 报,是因为单条消息便宜到,若按条报价将全是零。这种表述掩盖了在真实对话里计价表叠加得有多快:每一轮都会把之前说过的一切重新发一遍。

下面这张表列出了几个模型的全部四个计价表,取自驱动本站模型选择器和费用计算器的同一份 metadata feed。注意输入那一列能告诉你的有多少:两个输入价相同的模型,在输出上可以相差三倍,而输出才是波动最大的那个计价表。

  • 输入(Input):你发出去的一切,你的消息、到目前为止的对话、任何 system prompt、任何附带的文本。
  • 输出(Output):模型写回来的一切,包括会产出推理 token 的模型上的那些推理 token。
  • 缓存输入读取(Cached input read):供应商已经见过的重复上下文,按远低于新鲜输入的费率计费。
  • 缓存写入(Cache write):部分供应商为把那段上下文放进缓存本身所收的费。
LLM API 定价到底是怎么回事
模型输入(USD / 1M tokens)输出(USD / 1M tokens)缓存输入读取缓存写入
Claude Haiku 4.51.005.000.101.25
Claude Sonnet 52.0010.000.202.50
GPT-5.6 Luna1.006.000.101.25
GPT-5.6 Terra2.5015.000.253.125
Kimi k2.50.603.000.100.60
Qwen3.7 Plus0.503.000.050.625
MiniMax-M2.50.301.200.030.375

输出 token 才是贵的那一半

LLM 定价里最可靠的规律,就是写比读贵。为了给它一个数字而不是一个印象,我们取了 Oriveo metadata feed 里每一个公示了单 token 价格的文本模型(覆盖全部 15 家供应商),把每个模型的输出费率和它自己的输入费率作比较,数据截至 2026 年 7 月 24 日。

中位数的模型,输出的收费正好是输入的四倍。大约每十个模型里有一个对两者同价、或输出更便宜,这在由推理托管方提供的开放权重模型里很典型。在另一端,大约每七个里有一个的收费高于六倍,而 feed 里差距最大的达到十二倍。

这对你怎么花钱有直接影响。裁剪 prompt 是所有人第一个伸手去够的优化,而它通常是较小的那根杠杆。要求更短的答案、给输出长度设上限,或选一个不会长篇大论地「想出声」的模型,比从问题里砍掉一段更能拉动账单。推理型模型在这里值得再看一眼,因为它们生成的思考 token 即便你从没看到,也按输出计费。

输出 token 才是贵的那一半
输出价相对输入价在有定价的文本模型中的占比
相同或更便宜(1× 或更低)10%
1× 到 2×11%
2× 到 4×39%
4× 到 6×25%
高于 6×15%

真正推高你账单的是什么

人们第一次收到 API 账单时会吃惊,通常出于四个原因之一,而没有一个是模型那个「头条价」。下面这些机制对每一家供应商都成立,因为它们源自聊天 API 的工作方式,而非任何厂商的政策。

最大的那个是上下文重发。一次 API 调用是无状态的:模型对你上一轮没有记忆,所以客户端必须在每条消息里把整段对话重新发一遍。一条跑了四十轮的线索,在第四十一轮会把四十轮历史当作输入发出去。因此一段对话的成本大致随其长度的平方增长,这也是为什么一条长线索可能比二十条覆盖同样内容的短线索还贵。

Prompt caching 是那个抵消力量,值得在你把它一笔带过之前先弄懂。支持它的供应商,会让重复的上下文按缓存读取而非新鲜输入计费。在我们测的这份 feed 里,大约每五个模型有一个公示了缓存读取价,而在有它的地方,缓存费率的中位数落在该模型自身输入价的 10%:我们找到的最低不到 1%,最高约 58%。有些供应商还会为写入缓存收费,通常比正常输入高一档,所以缓存在同一段上下文被复用好几次时才划算,用一次则不然。

  • 对话历史:每一轮都完整重发,所以长线索的花费不成比例地更多。
  • System prompt 与预设:可复用的指令会被前置到每一条消息,悄悄把它们的 token 数翻倍。
  • 附件:丢进聊天里的一份文档或一张图会变成输入 token,并且在该线索之后的每一轮里都留在上下文中。
  • 推理 token:在会生成它们的模型上按输出计费,无论推理是否被展示出来。
  • 重试与重新生成:一次重新生成的答案是第二次完整计费的请求,而不是一次免费的更正。

15 家供应商的价格版图

下面这张表是 Oriveo 接入的 15 家供应商各自公示输入价区间的一个快照。它只计入公示了单 token 价格的文本模型,并给出该供应商这类模型里最便宜和最贵的两个。它是一张「各供应商落在哪」的地图,而不是推荐:一家供应商最便宜的模型和最贵的模型,彼此很少能互相替代。

来源与方法,方便你核对:每一个数字都来自 Oriveo 生产环境的 metadata feed,位于 api.oriveoai.com/api/metadata,contract version 47,生成于 2026-07-24T01:00:09Z,正是应用用来为消息定价、以及本站费用计算器背后所用的同一份 feed。价格以美元每百万 token 计,数据截至 2026 年 7 月 24 日。图像生成模型,以及供应商按请求而非按 token 定价的模型,均已排除,因为对它们来说一个单 token 数字毫无意义。

有两件事很突出。第一是跨度:截至 2026 年 7 月 24 日,整份 feed 里最便宜的输入价是每百万 token $0.01,最贵的是 $150,同一个选择器里两行之间相差一万五千倍。第二是目录的广度和便宜是两条不同的轴:聚合器承载最宽的区间,因为它们转售很多家供应商,而单一供应商则紧紧聚在自家的分层价位附近。

把这里的每一个数字都当作易腐品。供应商不断重新定价、推出更便宜的档位、下线模型;下表里就有好几行在过去一个季度内变过。任何援引模型价格的文章都是一张照片,这也正是那份实时 feed 和计算器存在的理由,也是本页写明抓取日期、而非暗示这些数字永久有效的原因。

15 家供应商的价格版图
供应商有公示 token 价的文本模型数最低输入(USD / 1M)最高输入(USD / 1M)
OpenAI490.05150
Anthropic (Claude)101.0015
Google Gemini210.0752.00
xAI Grok61.002.00
DeepSeek40.140.435
Mistral320.042.00
Qwen490.0352.80
Kimi90.202.00
MiniMax70.300.60
Z.ai120.071.40
Groq70.030.59
Together AI690.023.50
Fireworks AI150.072.80
OpenRouter3050.01150
SiliconFlow490.041.74
继续了解在费用计算器里,用你自己的用量给一个模型算价

同一个模型为什么会有不止一个价

打开两份模型目录,你会发现同一个模型被标了不同的费率。这通常不是错误。开放权重模型由好几家推理托管方提供,各自有自己的硬件、吞吐和利润,所以一个模型在一家托管上的价格和另一家上确实可以不同。在上面那份 feed 里,同一个开放权重系列就以真正不同的费率出现在好几家供应商那里。

第二个原因是你经由哪一层购买。聚合器处在你和底层供应商之间,得靠某种方式为这个位置买单:通过 token 价上的价差、一笔充值费、按请求的百分比,或一套 credit 体系(它和 token 的换算由平台而非供应商价目表定义)。这些机制本身没有一个是坏的;关键在于机制是否公开。举例来说,截至 2026 年 7 月 24 日,OpenRouter 公示的政策是银行卡充值收 5.5% 的费用、最低 $0.80,而对你自带的 key,每月前一百万次请求不收费,超出部分按模型正常价的 5% 以 credits 扣除。

你在比较平台时值得问的问题,不是「一个 credit 多少钱」,而是「从供应商 list 价到我被收的费,那条公示的换算路径是什么」。如果一个平台以 credits 计价,又不公布那个换算,那你在做的比较就不是和模型的价格比,而是和平台的定价政策比,而那套政策可以在模型价格分毫未动的情况下就改变。

继续了解从原生客户端使用 OpenRouter 模型

订阅还是按量付费:对你来说哪个更便宜

这是大多数人真正带着来的问题,而它没有一个通用答案。一份固定月费订阅和按量计费的 API 访问,会在某个用量处交叉,而那个交叉点取决于你自己的消息:多长、答案多长、你选哪个模型、你的线索跑多久。任何不看你的数字就报一个省钱百分比的人,都是在猜。

你大约五分钟就能算出来,算术并不难。取一个真正典型的一周,而不是你最忙的那一周。数一数消息条数。以词为单位估一下你拿到的答案的平均长度,再乘以大约 1.35 得到 token 数。加上输入那一侧,记得每一轮都会把到目前为止的线索重发一遍。乘以模型公示的输入和输出费率,再和你在考虑的月费作比较。本站的费用计算器会对着实时价格帮你做这件事,这样你就不必自己维护那些费率。

有几个结构性规律稳定到可以在不编造数字的前提下直说。用量轻或忽高忽低时、偶尔用好几个模型而不是重度用一个时、以及大部分工作是短问短答时,按量访问往往胜出。日常用量持续很高时,订阅往往胜出,而且它有一个真实的非财务优势:一份可预期的账单。看不到逐条消息费用的按量访问,是两头不讨好的最差情形,而这恰恰是「每条消息一个费用估算」意在防止的失败模式。

继续了解在 AI API 费用计算器里把数字跑一遍对比 Oriveo 各方案分别包含什么

怎样真正减少你的花费

一旦你能看到这些计价表,大部分节省来自少数几个习惯,而不是去搜最便宜的供应商。按对一个典型聊天工作负载拉动数字幅度的大致顺序排列:

通常不管用的,是把一切都切到目录里最便宜的模型。一个要试三次才把答案答对、价格却只有五分之一的模型,不是节省,而且还搭上你的时间。这条建议有用的版本,是让模型与任务相配:便宜模型做抽取、格式化、摘要和翻译,贵模型做那些你本来会付钱请人来干的活。

  • 为新话题另起一段新对话。这是最大的单根杠杆,因为它让你不再为重发一段无关历史而付费。
  • 想要更短的答案时就明说要更短的答案。在大约每十个模型里的九个上,输出都是更贵的那个计价表。
  • 让模型与任务相配,而不是遇事就默认掏出最强的那个。
  • 把 system prompt 和可复用预设保持精简:每一条用到它们的消息都会为它们计费。
  • 在供应商支持、且你反复复用同一段长上下文时,使用 prompt caching。
  • 用完就把附件从线索里移除,而不是让它们随之后每一轮一路带下去。
  • 在把某个模式重复一百遍之前,先看一眼那条消息上的估算。

Oriveo 怎么把费用给你看

Oriveo 里的每条消息都带一个费用估算,在答案结束的那一刻,按供应商公示的 token 定价和实际上报的 token 算出来。这个估算在每一层都有,包括免登录那层,因为一个只有付费方案才看得到的费用,帮不了你决定要不要为任何东西付费。上面那些表里用到的同一份 metadata feed,正是提供这些价格的来源,这也是应用不需要你去维护一份价目表的原因。

它是一个估算,而且被明确标注为估算。供应商会套用各自的取整、最小可计费单位、按账户的费率以及偶尔的促销价,而 token 数是由供应商事后上报的。这个估算存在的意义是在一个月里为决策把方向;供应商的账单才是最终依据,两者不一致时以账单为准。

更深入的分析在付费方案之后。Usage Insights(按供应商和模型拆分的花费、月度趋势和预算提醒)属于 Pro 与 Lifetime;截至 2026 年 7 月 24 日,价格为月付 $9.99、年付 $59.99 或一次性付费 $149.99。这些方案买的只是软件功能:它们不含任何 AI 用量、不含模型 credits、不含供应商订阅,所以应用的价格和你 token 的价格,永远不会被捆成一个你拆不开的数字。

一个用量分析界面,把 AI 花费按供应商和模型拆开
逐条消息的估算在每一层都有;按供应商和模型的拆分属于付费方案。
继续了解付费方案包含什么、又不含什么

这些数字告诉不了你的事

一张价格表是起点,不是决定。有三件它没写进去的事值得明说,因为它们经常会把一个仅凭价格看似已定的比较翻转过来。

第一是每个任务用掉的 token 数。两个同费率的模型,在抵达同一个答案时花掉的 token 数可以相差很大,而一个啰嗦的便宜模型,每完成一件活的花费可能比一个惜字如金的贵模型还高。第二是重试率:一个你不得不重新生成的答案会被计费两次。第三是 token 计价表之外的一切:速率限制、延迟、上下文窗口、在你所在地区的可用性,以及模型能不能读你工作用的那些文件格式。

诚实地使用像本文这样的比较,是把它当作一层入围筛选。排掉那些明显超出你预算的行,拿两三个候选放到你自己的真实工作上试,然后看一件完成的活花多少,而不是看一百万 token 花多少。逐条消息的估算之所以存在,正是为了让这个实验只花一天、而不是一个计费周期。

常见问题

  1. 向一个 LLM API 发一条消息到底要花多少?

    这取决于四个计价表,而不是一个:你发出去的 token、模型写回来的 token、从缓存读取的 token,以及在部分供应商那里写入缓存的 token。一个短问题发给一个中等价位的模型,通常只花几分之一美分,但同样的问题放在一条长线索的末尾就更贵,因为整段对话在每一轮都被当作输入重发。

  2. 为什么输出比输入更贵?

    生成 token 是顺序进行、且受算力约束的,读取 prompt 则不然,所以供应商给它定价更高。截至 2026 年 7 月 24 日,在所测的 15 家供应商里,中位数的模型输出收费是输入的四倍,大约每七个里有一个高于六倍。要求更短的答案,通常比缩短你的 prompt 是更大的一根杠杆。

  3. Prompt caching 真的能减少账单吗?

    在同一段长上下文被复用好几次时可以。在所测的 feed 里,大约每五个模型有一个公示了缓存读取价,而在有它的地方,它落在该模型自身输入费率的中位数 10%。有些供应商还会为写入缓存收费,所以给一段只用一次的上下文做缓存,可能比完全不缓存还略贵一点。

  4. 按量付费的 API 比一份月度 AI 订阅便宜吗?

    用量轻或忽高忽低时通常是;日常持续重度使用时,固定月费往往胜出。没有一个通用的百分比,因为交叉点取决于你的消息量、答案长度和模型选择。用费用计算器、对着当前价格估一个典型的一周,而不是去相信一个笼统的说法。

  5. 为什么同一个模型在不同平台价格不同?

    两个原因。开放权重模型由好几家硬件和利润各异的推理托管方提供,所以相同的权重确实可以带不同费率。而转售访问权的平台会加上自己那一层:一个价差、一笔充值费、一个百分比,或一套 credit 体系。要问的问题是:从供应商 list 价到你被收的费,那条路径是否公开。

  6. 本文里的价格有多新?

    每一个数字都取自 Oriveo 生产环境的 metadata feed,取于 2026 年 7 月 24 日,contract version 47,生成于 2026-07-24T01:00:09Z。供应商价格经常变,所以把这些数字当作那一天的快照。本站的费用计算器实时读取同一份 feed,那才是核对当前费率的正确地方。

  7. Oriveo 会在供应商收费之上加价吗?

    不会。用你自己的 API key 时,每家供应商按公示的 list 价直接向你自己的账户开账单,Oriveo 不在其上抽取任何东西。托管用量按各模型的官方 list 价从一份预付余额扣费。Oriveo 的付费方案覆盖的是跨设备同步、用量分析这类软件功能;它们不含任何 AI 用量或模型 credits。

发消息的同时就看到每条花了多少

Oriveo 在每条消息上按供应商 list 价显示一个费用估算,跨 15 家官方供应商、500+ 模型,覆盖 iPhone、Android 与 Web,对供应商用量不加价。