LLM API 定價

AI API 費用比較:LLM 定價實際怎麼算

LLM API 的價錢實際由什麼組成、什麼在推高帳單,以及 15 家供應商真實的輸入與輸出價區間。數字取自 2026 年 7 月 24 日。

Oriveo Team發布於 更新於 約 11 分鐘
  • LLM API 最多分成四個計費項目收費,多數價格比較只看了其中一個。
  • 輸出 token 的價格中位數是輸入的四倍,最大可以到十二倍。
  • 截至 2026 年 7 月 24 日,15 家供應商公示的輸入價,從每百萬 token $0.01 到 $150。
iPhone 上的 Oriveo:對話清單,每則對話右側顯示預估費用。

LLM API 的價錢實際怎麼算

幾乎每篇 AI API 費用比較,每個模型都只列一個數字,而且幾乎總是輸入價。它是供應商公布的四個數字裡,參考價值最低的一個。模型是分項計費的:你送進去的 token、它寫回來的 token、從快取讀到的 token,以及部分供應商要另外收費的、寫進快取的 token。每一項都有自己的費率,彼此差很多。

一個 token 大約是四分之三個英文單字,所以一百萬 token 大約是 750,000 個字。價格是按每百萬 token 報,因為單則訊息便宜到如果按則報價,數字會小到幾乎全是零。這種標示方式看不出真實對話裡費用累積得有多快:每一輪都會把前面說過的內容全部再送一次。

下面這張表列出幾個模型的四項計費價格,資料取自本站模型選單和費用計算機所用的同一份 metadata feed。要注意,輸入那一欄能告訴你的其實很少:這裡的輸入價落在 0.30 到 2.50 美元之間,輸出價卻從 1.20 拉到 15.00 美元,而輸出正是變動最大的一項。

  • 輸入:你送出的一切。你的訊息、到目前的對話、任何 system prompt、任何附上的文字。
  • 輸出:模型寫回來的一切,包含會產生 reasoning token 的模型上那些 token。
  • 快取輸入讀取:供應商已經看過的重複上下文,費率比全新輸入低很多。
  • 快取寫入:有些供應商為了把那段上下文放進快取,一開始就收的費用。
LLM API 的價錢實際怎麼算
模型輸入(USD / 1M tokens)輸出(USD / 1M tokens)快取輸入讀取快取寫入
Claude Haiku 4.51.005.000.101.25
Claude Sonnet 52.0010.000.202.50
GPT-5.6 Luna1.006.000.101.25
GPT-5.6 Terra2.5015.000.253.125
Kimi k2.50.603.000.100.60
Qwen3.7 Plus0.503.000.050.625
MiniMax-M2.50.301.200.030.375

貴的那一半是輸出 token

LLM 定價裡最穩定的規律是「寫比讀貴」。為了給出具體的數字而不是印象,我們取 Oriveo metadata feed 裡每一個有公布逐 token 價格的文字模型,涵蓋全部 15 家供應商,拿每個模型的輸出費率和它自己的輸入費率相比。資料時間是 2026 年 7 月 24 日。

中位數的模型,輸出價正好是輸入價的四倍。大約十個裡有一個,輸出和輸入同價,或輸出更便宜,這在推論主機上的 open-weight 模型很常見。另一端則是大約七個裡有一個超過六倍,這份 feed 裡最大的差距是十二倍。

這會直接影響你怎麼省錢。先縮短提示詞是大家最先想到的做法,但通常效果比較小。要求更短的答案、限制輸出長度,或選一個不會把思考過程寫很長的模型,對帳單的影響通常大於把問題刪掉一段。reasoning 模型要特別留意:它們產生的思考 token 按輸出計費,就算你根本看不到。

貴的那一半是輸出 token
輸出價相對輸入價有標價的文字模型佔比
一樣或更便宜(1 倍或更低)10%
1 倍到 2 倍11%
2 倍到 4 倍39%
4 倍到 6 倍25%
超過 6 倍15%

帳單真正被什麼推高

人們第一次收到 API 帳單會訝異,通常是四個原因之一,沒有一個是模型那個標題價格。下面這些機制對每一家供應商都成立,因為它們來自聊天 API 怎麼運作,不是哪一家的政策。

最大的是上下文重送。API 呼叫是無狀態的:模型不記得你上一輪,所以用戶端每一則都得把整段對話再送一次。一條跑了四十輪的線索,在第四十一輪會把四十輪歷史當成輸入送出去。一段對話的費用因此大致隨長度的平方成長。這就是為什麼一條長線索可能比二十條涵蓋同樣內容的短線索更貴。

Prompt caching 是對沖的那一側,值得在你把它略過之前先懂。支援的供應商會把重複上下文按快取讀取計費,而不是按全新輸入。在我們量過的這份 feed 裡,大約五個模型有一個公布了快取讀取價;在有這個價格的模型上,快取費率的中位數是該模型自己輸入價的 10%。我們看到的最低不到 1%,最高大約 58%。有些供應商寫入快取也收費,通常比正常輸入貴一截。所以同一段上下文被重複用好幾次才划算,只用一次就不划算。

  • 對話內容:每一輪都整段重送,所以長對話會貴得不成比例。
  • System prompt 和預設:可重複使用的指示會加在每一則訊息前面,悄悄讓 token 數倍增。
  • 附件:丟進聊天的文件或圖片會變成輸入 token,而且在這段對話後續的每一輪,都會留在上下文裡。
  • Reasoning token:會產生這類 token 的模型按輸出計費,不管推理過程有沒有顯示都一樣。
  • 重試和重新生成:重新生成的答案是第二次完整計費的請求,不是免費的。

15 家供應商的價格地圖

下面這張表是 Oriveo 接到的 15 家供應商,各自公示輸入價的範圍快照。只計算有公布逐 token 價格的文字模型,並列出該家最便宜和最貴的。它是一張每家坐在哪裡的地圖,不是推薦:同一家最便宜和最貴的模型,很少能互相替代。

來源和方法寫在這裡,方便你查:每個數字都來自 Oriveo 生產環境的 metadata feed,網址是 api.oriveoai.com/api/metadata,contract version 47,產生時間 2026-07-24T01:00:09Z。App 用來給訊息標價的是同一份,本站費用計算機背後也是它。價格是美元、每百萬 token,截至 2026 年 7 月 24 日。影像生成模型,以及供應商按次而不是按 token 計價的模型,都排除了,因為對它們報一個逐 token 數字沒有意義。

有兩件事很突出。第一是跨度:整份 feed 最便宜的輸入價是每百萬 token $0.01,最貴是 $150,截至 2026 年 7 月 24 日,同一個選擇器裡兩列相差一萬五千倍。第二是目錄有多寬和便不便宜是兩條軸:聚合器區間最寬,因為它們轉售很多家;單一供應商則緊緊聚在自己的分級附近。

這裡每個數字都當成會過期的。供應商會改價、推出更便宜的檔、不斷下架模型;下面有幾列在過去這一季裡變過。任何引用模型價格的文章都是一張照片。所以才有即時的 feed 和計算機,這頁也寫下擷取日期,而不是暗示數字永久有效。

15 家供應商的價格地圖
供應商有公示 token 價的文字模型數最低輸入(USD / 1M)最高輸入(USD / 1M)
OpenAI490.05150
Anthropic (Claude)101.0015
Google Gemini210.0752.00
xAI Grok61.002.00
DeepSeek40.140.435
Mistral320.042.00
Qwen490.0352.80
Kimi90.202.00
MiniMax70.300.60
Z.ai120.071.40
Groq70.030.59
Together AI690.023.50
Fireworks AI150.072.80
OpenRouter3050.01150
SiliconFlow490.041.74

同一個模型為什麼不止一個價

打開兩份模型目錄,你會看到同一個模型掛著不同費率。那通常不是寫錯。open-weight 模型由好幾家推論主機提供,硬體、吞吐和利潤都不同,所以同一個模型在一家是這個價、在另一家是另一個價,可以是真的。上面那份 feed 裡,同一個 open-weight 家族在好幾家供應商上的費率確實不一樣。

第二個原因是你透過哪一層買。聚合器站在你和底下供應商之間,得用某種方式養這個位置:token 價格上的價差、儲值手續費、按請求抽成,或一套 credit 制度,credits 怎麼換成 token 由平台定義,不是由供應商價目表定義。這些沒有哪一個天生是壞的;要緊的是機制有沒有公開。以 OpenRouter 為例,條款是公開寫的:截至 2026 年 7 月 24 日,公示政策是銀行卡儲值收 5.5%、最低 $0.80;你自己帶的金鑰,每個月前一百萬次請求不收費,超過之後按該模型正常價格的 5% 以 credits 扣除。

比較平台時,值得問的不是一個 credit 多少錢,而是從供應商的定價到你被收的錢,公開的路徑是什麼。若平台用 credits 計價卻不公布這個換算,你在比的不是模型的價格,而是平台的定價政策。那個政策可以變,模型的價格完全沒變。

訂閱還是用多少付多少,哪個對你比較省

這才是多數人真正想問的問題,而它沒有通用的答案。固定月費的訂閱和按量計費的 API,會在某個用量上打平。打平的點取決於你的訊息有多長、答案有多長、你選哪個模型、對話進行多久。任何人在沒有你的數字時,就說能省下多少百分比,都只是猜測。

大約五分鐘就能算完,算法並不難。拿真正典型的一週,不要拿最忙的那一週。先數訊息則數,再把你拿到的答案平均長度用字數估出來,乘上大約 1.35 換算成 token。再加上輸入那一側,記得每一輪都會把到目前為止的對話重送。乘上模型公布的輸入和輸出費率,再和你考慮的月費比較。本站的費用計算機會用即時價格幫你算,所以你不用自己記費率。

有幾個規律夠穩定,不用編數字也能說。用量少或忽多忽少、偶爾才用好幾個模型而不是固定用同一個、而且多半是短問短答的人,按量計費通常比較有利。每天穩定地大量使用的人,訂閱通常比較有利,而且還有一個和錢無關的好處:帳單金額固定。最糟的是按量計費又看不到每一則花多少,等於兩邊的缺點加在一起。每一則訊息上的預估費用,就是為了避免這種情況。

真的想少花,要改的是習慣

一旦看懂這些計費項目,多數省下來的錢,都來自少數幾個習慣,而不是去追清單裡最便宜的那一家。以一般的聊天用量來看,大致依效果由大到小排列如下:

通常沒用的做法,是全部換成清單裡最便宜的模型。一個只要五分之一價錢、卻要試三次才答對的模型,並沒有比較省,時間也花掉了。有用的做法是讓模型配合任務:擷取資料、排版、摘要、翻譯用便宜的;貴的留給你原本會花錢請人做的工作。

  • 新題目就新開一段對話。這是效果最大的一招,因為你不用再為重送一段無關的對話內容付錢。
  • 想要短答案就直接要求簡短。大約十個模型裡有九個,輸出價比輸入價貴。
  • 讓模型配合任務,不要每件事都預設用最強的那個。
  • 把 system prompt 和可重複使用的預設寫精簡。每一則用到它們的訊息都會計費。
  • 供應商有支援、而且你會反覆使用同一段很長的上下文時,再用 prompt caching。
  • 附件用完就從這段對話移除,不要讓它跟著後面每一輪重送。
  • 同一種做法要重複一百次之前,先看這一則的預估費用。

Oriveo 怎麼讓費用一目了然

Oriveo 的每一則訊息都帶預估費用,在答案結束的那一刻,用供應商公示的 token 價格和實際上報的 token 算出來。這個估算每一層都有,包括不用登入的那層,因為只有付費方案才看得到的費用,幫不了你決定要不要為任何東西付錢。上面那些表用的同一份 metadata feed 就是這些價格的來源,所以 App 不需要你自己維護一份價目表。

它是估算,也標成估算。供應商會套自己的進位、最低計費單位、依帳戶而異的費率,以及偶爾的促銷價;token 數是供應商事後回報的。估算是用來在這個月裡調決定的;供應商的帳單才是最終依據。兩邊不合時,以帳單為準。

更深的分析在付費方案後面。Usage Insights,也就是按供應商和模型拆開的花費、月趨勢和預算提醒,屬於 Pro 和終身版。截至 2026 年 7 月 24 日,價格是月付 $9.99、年付 $59.99,或一次付清 $149.99。這些方案買的只是軟體功能:不含 AI 用量、不含模型 credits、不含供應商訂閱。所以 App 的價格和你的 token 價格,不會被捆成一個拆不開的數字。

依供應商和模型拆開 AI 花費的用量分析畫面
逐則估算每一層都有;按供應商和模型拆開的部分屬於付費方案。

這些數字決定不了的事

價格表只是起點,不是結論。有三件事它沒說,值得講清楚,因為它們常常會讓一個看起來已經由價格決定的比較整個翻盤。

第一是每個任務要花多少 token。兩個費率相同的模型,為了得到同一個答案,花掉的 token 可能差很多;一個話很多的便宜模型,做完一件事可能比一個話少的貴模型還貴。第二是重試率:要重新生成的答案會計費兩次。第三是 token 計費以外的一切:速率限制、延遲、context window、你所在的地區能不能用,以及模型讀不讀得了你工作上用的檔案格式。

這種比較比較適合用來初步篩選。先劃掉明顯超出預算的,再用你自己的實際工作試兩三個,看的是做完一件事要花多少,而不是一百萬 token 要花多少。逐則預估費用的存在,就是為了讓這個實驗一天就能完成,而不必等一整個帳單週期。

常見問題

向 LLM API 送一則訊息,實際上要多少錢?
要看四個計費項目,不是只有一個:你送出的 token、模型寫回來的 token、從快取讀到的 token,以及部分供應商寫進快取的 token。對中價位的模型問一個短問題,通常只要不到一美分;同一個問題如果放在很長的對話尾端就更貴,因為每一輪都會把整段對話當成輸入再送一次。
為什麼輸出比輸入貴?
產生 token 是一個接一個依序進行、又受算力限制的,讀取提示則不是,所以供應商把輸出價訂得更高。截至 2026 年 7 月 24 日,在我們統計的 15 家供應商裡,中位數的模型輸出價是輸入價的四倍,大約七個裡有一個超過六倍。要求更短的答案,通常比縮短提示詞更能省錢。
Prompt caching 真的會讓帳單變小嗎?
同一段很長的上下文被重複用好幾次時,可以。在我們統計的這份 feed 裡,大約五個模型有一個公布了快取讀取價;在有這個價格的模型上,中位數是該模型自己輸入費率的 10%。有些供應商寫入快取也收費,所以一段只用一次的上下文若做快取,可能比完全不快取還略貴一點。
用多少付多少的 API,會比每月的 AI 訂閱便宜嗎?
用量少或忽多忽少時通常會;每天穩定地大量使用時,固定月費常常更划算。沒有通用的百分比,因為打平的點取決於你的訊息量、答案長度和模型選擇。拿典型的一週,用費用計算機依目前價格估算,不要相信籠統的說法。
為什麼同一個模型在不同平台價格不同?
兩個原因。open-weight 模型由好幾家推論主機提供,硬體和利潤不同,所以同一組權重可以真的掛著不同費率。轉售存取的平台還會再加一層:價差、儲值手續費、抽成,或一套 credit 制度。要問的是,從供應商定價到你被收的錢,這條路徑有沒有公開。
這篇文章裡的價格有多新?
每個數字都取自 Oriveo 正式環境的 metadata feed,時間是 2026 年 7 月 24 日,contract version 47,產生於 2026-07-24T01:00:09Z。供應商價格常常調整,所以請把這些數字當成那一天的快照。站上的費用計算機會即時讀取同一份 feed,要查目前的費率,請用那個。
Oriveo 會在供應商收取的費用上加價嗎?
不會。用你自己的 API 金鑰時,各家供應商按公示的定價向你自己的帳戶開帳單,Oriveo 上面不抽成。託管用量從預付餘額按各模型的官方定價扣。Oriveo 的付費方案買的是軟體功能,例如跨裝置同步和用量分析;不含 AI 用量,也不含模型 credits。

延伸閱讀

送出的時候就看到這一則大概花多少

Oriveo 在每則訊息上顯示依供應商定價算出的預估費用,涵蓋 15 家官方供應商與 700+ 模型,用在 iPhone、Android 和網頁版,供應商用量不加價。