Giá API của LLM

So sánh chi phí API AI: giá LLM thực sự tính thế nào

Giá API của LLM gồm những gì, thứ gì đẩy hóa đơn lên, và khoảng giá đầu vào cùng đầu ra thật trên 15 nhà cung cấp, đo ngày 24 tháng 7 năm 2026.

Oriveo TeamĐăng ngày Cập nhật Đọc trong 19 phút
  • API của LLM tính trên tối đa bốn khoản tính phí riêng, còn phần lớn bài so giá chỉ nhìn một khoản tính phí.
  • Token đầu ra có giá trung vị gấp bốn lần token đầu vào, và có thể lên tới mười hai lần.
  • Trên 15 nhà cung cấp, giá đầu vào đã công bố chạy từ $0.01 tới $150 cho mỗi triệu token, tính đến ngày 24 tháng 7 năm 2026.
Oriveo trên iPhone: danh sách trò chuyện, kèm chi phí ước tính của từng cuộc ở bên phải.

Giá API của LLM thực sự tính thế nào

Hầu hết bài so chi phí API AI đều nêu một con số cho mỗi mô hình, và con số đó gần như luôn là giá đầu vào. Trong bốn con số mà một nhà cung cấp công bố, đó là con số ít hữu ích nhất. Một mô hình tính trên các khoản tính phí tách riêng: token bạn gửi vào, token nó viết ra, token đọc từ cache, và với một số nhà cung cấp, token ghi vào cache đó. Mỗi khoản có mức giá riêng, và các mức đó không gần nhau.

Một token tương đương khoảng ba phần tư từ tiếng Anh, nên một triệu token vào khoảng 750.000 từ. Giá được báo theo mỗi triệu token vì từng tin nhắn rẻ tới mức giá theo tin sẽ toàn số 0. Cách nói đó che mất việc các khoản tính phí cộng dồn nhanh thế nào trong một cuộc trò chuyện thật, nơi mỗi lượt gửi lại mọi thứ đã nói trước đó.

Bảng bên dưới hiện cả bốn khoản tính phí cho một vài mô hình, lấy từ cùng nguồn metadata đang chạy bộ chọn mô hình và máy tính chi phí trên trang này. Hãy xem cột đầu vào ít nói được điều gì: giá đầu vào ở đây chỉ từ 0,30 đến 2,50 đô la, còn giá đầu ra trải từ 1,20 đến 15,00 đô la, và đầu ra mới là khoản tính phí nhảy mạnh nhất.

  • Đầu vào: mọi thứ bạn gửi, gồm tin nhắn của bạn, cuộc trò chuyện tới lúc đó, mọi prompt hệ thống, mọi văn bản đính kèm.
  • Đầu ra: mọi thứ mô hình viết lại, kể cả token suy luận trên các mô hình có sinh ra chúng.
  • Đọc đầu vào từ cache: phần ngữ cảnh lặp lại mà nhà cung cấp đã thấy, tính ở mức thấp hơn nhiều so với đầu vào mới.
  • Ghi cache: khoản một số nhà cung cấp tính để đưa ngữ cảnh đó vào cache ngay từ đầu.
Giá API của LLM thực sự tính thế nào
Mô hìnhĐầu vào (USD / 1 triệu token)Đầu ra (USD / 1 triệu token)Đọc đầu vào từ cacheGhi cache
Claude Haiku 4.51.005.000.101.25
Claude Sonnet 52.0010.000.202.50
GPT-5.6 Luna1.006.000.101.25
GPT-5.6 Terra2.5015.000.253.125
Kimi k2.50.603.000.100.60
Qwen3.7 Plus0.503.000.050.625
MiniMax-M2.50.301.200.030.375

Token đầu ra là nửa đắt

Quy luật đáng tin nhất trong giá LLM là viết đắt hơn đọc. Để có một con số chứ không phải một ấn tượng, chúng tôi lấy mọi mô hình văn bản trong nguồn metadata của Oriveo có công bố giá theo token, trên cả 15 nhà cung cấp, rồi so mức đầu ra của từng mô hình với chính mức đầu vào của nó, tính đến ngày 24 tháng 7 năm 2026.

Mô hình ở mức trung vị tính đầu ra đắt gấp bốn lần đầu vào. Khoảng một mô hình trên mười tính hai đầu bằng nhau, hoặc đầu ra còn rẻ hơn, kiểu thường gặp ở mô hình trọng số mở do các máy chủ suy luận phục vụ. Ở đầu kia, khoảng một trên bảy tính hơn sáu lần, và khoảng cách rộng nhất trong nguồn là mười hai lần.

Điều này đổi thẳng cách bạn tiêu tiền. Cắt prompt là tối ưu đầu tiên ai cũng nghĩ tới, và thường là đòn bẩy nhỏ hơn. Xin một câu trả lời ngắn hơn, giới hạn độ dài đầu ra, hoặc chọn một mô hình không nghĩ thành tiếng dài dòng, sẽ giảm hóa đơn nhiều hơn là gọt bớt một đoạn trong câu hỏi. Các mô hình suy luận đáng để bạn để ý ở đây, vì token suy nghĩ chúng sinh ra được tính là đầu ra ngay cả khi bạn không nhìn thấy.

Token đầu ra là nửa đắt
Giá đầu ra so với giá đầu vàoTỷ lệ mô hình văn bản có giá
Bằng hoặc rẻ hơn (1 lần trở xuống)10%
Từ 1 lần tới 2 lần11%
Từ 2 lần tới 4 lần39%
Từ 4 lần tới 6 lần25%
Hơn 6 lần15%

Thứ gì thực sự đẩy hóa đơn của bạn

Người ta thường ngạc nhiên với hóa đơn API đầu tiên vì một trong bốn lý do, và không lý do nào là giá tiêu đề của mô hình. Cơ chế bên dưới đúng với mọi nhà cung cấp, vì chúng xuất phát từ cách API chat hoạt động, không phải từ chính sách của một hãng.

Thứ lớn nhất là việc gửi lại ngữ cảnh. Một lời gọi API không giữ trạng thái: mô hình không nhớ lượt trước của bạn, nên client phải gửi lại cả cuộc trò chuyện với mỗi tin nhắn. Một luồng đã chạy bốn mươi lượt sẽ gửi bốn mươi lượt lịch sử làm đầu vào ở lượt bốn mươi mốt. Chi phí một cuộc trò chuyện vì thế tăng gần như theo bình phương độ dài của nó. Đó là lý do một luồng dài có thể đắt hơn hai mươi luồng ngắn xử lý cùng một việc.

Cache prompt là đối trọng, và đáng hiểu trước khi bạn gạt nó đi. Các nhà cung cấp hỗ trợ nó cho phép ngữ cảnh lặp lại được tính như một lần đọc cache thay vì đầu vào mới. Trong nguồn chúng tôi đo, khoảng một mô hình trên năm công bố giá đọc cache, và chỗ nào có thì mức cache nằm ở mức trung vị 10% giá đầu vào của chính mô hình đó. Mức thấp nhất chúng tôi thấy là dưới 1%, mức cao nhất quanh 58%. Một số nhà cung cấp còn tính phí để ghi cache, thường cao hơn đầu vào thường, nên cache mới có lời khi cùng một ngữ cảnh được dùng lại vài lần, không phải khi chỉ dùng một lần.

  • Lịch sử trò chuyện: được gửi lại đầy đủ ở mỗi lượt, nên luồng dài đắt lệch hẳn.
  • Prompt hệ thống và mẫu sẵn: những chỉ dẫn dùng lại được gắn vào trước mỗi tin nhắn, lặng lẽ nhân số token của chúng.
  • Tệp đính kèm: một tài liệu hoặc ảnh thả vào chat thành token đầu vào, và ở lại trong ngữ cảnh cho mọi lượt sau của luồng đó.
  • Token suy luận: được tính là đầu ra trên các mô hình sinh ra chúng, dù phần suy luận có được hiện hay không.
  • Thử lại và tạo lại: một câu trả lời tạo lại là một yêu cầu bị tính phí trọn vẹn lần thứ hai, không phải một lần sửa miễn phí.

Bức tranh giá trên 15 nhà cung cấp

Bảng bên dưới là một ảnh chụp khoảng giá đầu vào đã công bố ở từng nhà cung cấp trong 15 nhà cung cấp mà Oriveo nối tới. Nó chỉ đếm mô hình văn bản có công bố giá theo token, và hiện mô hình rẻ nhất và đắt nhất của nhà cung cấp đó. Đây là bản đồ chỗ mỗi nhà cung cấp đứng, không phải lời khuyên: mô hình rẻ nhất và đắt nhất của một nhà cung cấp hiếm khi thay được cho nhau.

Nguồn và cách làm, để bạn tự kiểm: mọi con số đến từ nguồn metadata sản xuất của Oriveo tại api.oriveoai.com/api/metadata, contract version 47, sinh lúc 2026-07-24T01:00:09Z. Đó cũng là nguồn ứng dụng dùng để định giá tin nhắn, và là nguồn đứng sau máy tính chi phí trên trang này. Giá tính bằng đô la Mỹ cho mỗi triệu token, tính đến ngày 24 tháng 7 năm 2026. Các mô hình tạo ảnh và các mô hình tính theo yêu cầu thay vì theo token bị loại ra, vì một con số theo token với chúng sẽ vô nghĩa.

Hai điều nổi lên. Thứ nhất là khoảng giá dàn rất rộng: giá đầu vào rẻ nhất trong cả nguồn là $0.01 mỗi triệu token và đắt nhất là $150, chênh mười lăm nghìn lần giữa hai hàng trong cùng một bộ chọn, tính đến ngày 24 tháng 7 năm 2026. Thứ hai là độ rộng danh mục và độ rẻ là hai trục khác nhau. Các bên tổng hợp mang khoảng rộng nhất vì họ bán lại nhiều hãng, còn nhà cung cấp một hãng thì tụ chặt quanh các bậc giá của chính họ.

Hãy coi mọi con số ở đây là dễ hết hạn. Nhà cung cấp đổi giá, mở bậc rẻ hơn và ngừng mô hình liên tục. Vài hàng bên dưới đã đổi trong quý vừa rồi. Bất kỳ bài nào trích giá mô hình cũng chỉ là một bức ảnh. Vì thế mới cần nguồn sống và máy tính, và vì thế trang này ghi ngày chụp thay vì ngầm hiểu các con số là vĩnh viễn.

Bức tranh giá trên 15 nhà cung cấp
Nhà cung cấpMô hình văn bản có giá token đã công bốĐầu vào thấp nhất (USD / 1 triệu)Đầu vào cao nhất (USD / 1 triệu)
OpenAI490.05150
Anthropic (Claude)101.0015
Google Gemini210.0752.00
xAI Grok61.002.00
DeepSeek40.140.435
Mistral320.042.00
Qwen490.0352.80
Kimi90.202.00
MiniMax70.300.60
Z.ai120.071.40
Groq70.030.59
Together AI690.023.50
Fireworks AI150.072.80
OpenRouter3050.01150
SiliconFlow490.041.74

Vì sao cùng một mô hình có hơn một giá

Mở hai danh mục mô hình và bạn sẽ thấy cùng một mô hình được liệt kê ở các mức khác nhau. Đó thường không phải lỗi. Mô hình trọng số mở được nhiều máy chủ suy luận phục vụ, mỗi máy có phần cứng, thông lượng và biên lợi nhuận riêng, nên một mô hình hoàn toàn hợp lệ khi có giá này trên máy nọ, giá khác trên máy kia. Trong nguồn phía trên, cùng một họ trọng số mở xuất hiện ở vài nhà cung cấp với các mức thực sự khác nhau.

Lý do thứ hai là lớp trung gian bạn mua qua. Các bên tổng hợp ngồi giữa bạn và nhà cung cấp bên dưới, và phải kiếm tiền từ vị trí đó bằng cách nào đó: một khoản chênh trên giá token, một phí nạp, một phần trăm trên yêu cầu, hoặc một hệ credit mà cách đổi sang token do nền tảng định nghĩa chứ không phải do bảng giá của nhà cung cấp. Không cách nào trong số đó xấu sẵn. Điều quan trọng là cơ chế có được công bố hay không. Ví dụ, OpenRouter công bố điều khoản công khai: tính đến ngày 24 tháng 7 năm 2026, chính sách đã công bố của họ là phí 5,5% khi nạp bằng thẻ với mức tối thiểu $0.80, và với key riêng của bạn, một triệu yêu cầu đầu tiên mỗi tháng không tính phí, vượt mức đó thì trừ 5% giá thường của mô hình bằng credit.

Khi bạn so các nền tảng, câu đáng hỏi không phải “một credit giá bao nhiêu” mà là “con đường đã công bố từ giá niêm yết của nhà cung cấp tới số tôi bị tính là gì”. Nếu một nền tảng tính bằng credit mà không công bố cách quy đổi đó, thì thứ bạn đang so không phải giá của mô hình. Bạn đang so chính sách giá của nền tảng, và chính sách đó có thể đổi mà giá của mô hình không đổi chút nào.

Thuê bao hay trả theo mức dùng: cái nào rẻ hơn với bạn

Đây là câu hỏi mà phần lớn người ta thực sự mang theo, và nó không có câu trả lời chung. Một thuê bao tháng cố định và quyền vào API tính theo mức dùng cắt nhau ở một lượng dùng nào đó, và điểm cắt đó tùy tin nhắn của chính bạn: chúng dài bao nhiêu, câu trả lời dài bao nhiêu, bạn chọn mô hình nào, và luồng của bạn chạy bao lâu. Ai nêu một phần trăm tiết kiệm mà không có số của bạn thì đang đoán.

Bạn tự tính được trong khoảng năm phút, và phép tính không khó. Lấy một tuần thực sự điển hình, không phải tuần bận nhất. Đếm tin nhắn. Ước lượng độ dài trung bình của câu trả lời bạn nhận, tính bằng từ, rồi nhân khoảng 1,35 để ra token. Cộng thêm phần đầu vào, nhớ rằng mỗi lượt đều gửi lại cả luồng từ đầu tới lúc đó. Nhân với mức đầu vào và đầu ra đã công bố của mô hình, rồi so với phí tháng bạn đang cân nhắc. Máy tính chi phí trên trang này làm việc đó với giá hiện hành, nên bạn không phải tự cập nhật các mức giá.

Vài quy luật đủ chắc để nêu ra mà không phải bịa số. Trả theo mức dùng thường thắng khi mức dùng nhẹ hoặc nhấp nhô, khi bạn thỉnh thoảng dùng vài mô hình chứ không dùng một mô hình rất nặng, và khi phần lớn việc là câu hỏi ngắn với câu trả lời ngắn. Thuê bao thường thắng khi lượng dùng cao đều mỗi ngày, và nó có một lợi thế không phải tiền: hóa đơn đoán trước được. Trả theo mức dùng mà không thấy chi phí từng tin nhắn là tệ nhất của cả hai bên, và đúng là kiểu hỏng mà một ước tính chi phí trên mỗi tin nhắn sinh ra để chặn.

Làm thế nào để thực sự giảm số tiền bạn tiêu

Một khi bạn nhìn thấy các khoản tính phí, phần lớn khoản tiết kiệm đến từ một số thói quen nhỏ chứ không phải từ việc săn nhà cung cấp rẻ nhất. Theo thứ tự gần đúng về mức chúng đẩy con số, với một tải chat điển hình:

Thứ thường không hiệu quả là chuyển mọi việc sang mô hình rẻ nhất trong danh mục. Một mô hình cần ba lần thử mới ra câu trả lời đúng, dù giá bằng một phần năm, thì chưa chắc là tiết kiệm, và nó còn tốn thời gian của bạn. Phiên bản hữu ích của lời khuyên này là khớp mô hình với việc: mô hình rẻ cho trích xuất, định dạng, tóm tắt và dịch; mô hình đắt cho việc bạn vốn sẽ trả một người để làm.

  • Mở một cuộc trò chuyện mới cho một chủ đề mới. Đây là đòn bẩy lớn nhất, vì nó ngăn bạn trả tiền để gửi lại một lịch sử không liên quan.
  • Xin câu trả lời ngắn hơn khi bạn muốn câu trả lời ngắn hơn. Với khoảng chín mô hình trong mười, đầu ra là khoản tính phí đắt hơn.
  • Khớp mô hình với việc, thay vì mặc định mô hình mạnh nhất cho mọi thứ.
  • Giữ prompt hệ thống và mẫu dùng lại cho gọn. Chúng bị tính trên mọi tin nhắn dùng chúng.
  • Dùng cache prompt ở chỗ nhà cung cấp hỗ trợ, và khi bạn dùng lại cùng một ngữ cảnh dài nhiều lần.
  • Gỡ tệp đính kèm khỏi một luồng khi bạn xong việc với chúng, thay vì mang chúng qua mọi lượt sau.
  • Xem ước tính trên một tin nhắn trước khi lặp mẫu đó một trăm lần.

Oriveo cho bạn thấy chi phí thế nào

Mỗi tin nhắn trong Oriveo mang một chi phí ước tính, tính từ giá token đã công bố của nhà cung cấp và số token thực sự được báo, ngay khi câu trả lời xong. Ước tính đó có trên mọi tầng, kể cả tầng không cần đăng nhập, vì một chi phí bạn chỉ thấy trên gói trả phí thì không giúp bạn quyết định có nên trả tiền cho thứ gì hay không. Các giá đó lấy từ cùng nguồn metadata dùng trong các bảng phía trên, nên ứng dụng không bắt bạn tự giữ một bảng giá.

Đó là ước tính, và nó được ghi là ước tính. Nhà cung cấp áp dụng cách làm tròn, đơn vị tính phí tối thiểu, giá theo từng tài khoản và thỉnh thoảng là giá khuyến mại của riêng họ, còn số token được nhà cung cấp báo sau khi xong. Ước tính đó để bạn chỉnh quyết định trong tháng. Hóa đơn của nhà cung cấp là lời cuối, và khi hai bên lệch thì hóa đơn đúng.

Phân tích sâu hơn nằm sau các gói trả phí. Usage Insights, tức chi tiêu tách theo nhà cung cấp và mô hình, xu hướng tháng và cảnh báo ngân sách, là một phần của Pro và Lifetime. Các gói đó giá $9.99 mỗi tháng, $59.99 mỗi năm hoặc $149.99 một lần, tính đến ngày 24 tháng 7 năm 2026. Chúng chỉ mua tính năng phần mềm: không gồm mức dùng AI, không credit mô hình và không thuê bao nhà cung cấp. Vì thế giá của ứng dụng và giá token của bạn không bao giờ bị gói vào một con số bạn không tách ra được.

Màn hình phân tích mức dùng, tách chi tiêu AI theo nhà cung cấp và mô hình
Ước tính theo từng tin nhắn có trên mọi tầng; phần tách theo nhà cung cấp và mô hình thuộc các gói trả phí.

Những con số này không nói được gì

Một bảng giá là điểm bắt đầu, không phải một quyết định. Ba thứ nó bỏ ngoài đáng nói thẳng, vì chúng thường lật ngược một so sánh mà nhìn giá thì tưởng đã xong.

Thứ nhất là số token cho mỗi việc. Hai mô hình cùng mức giá có thể khác nhau đáng kể ở chỗ chúng tiêu bao nhiêu token để tới cùng một câu trả lời, và một mô hình rẻ nhưng dài dòng có thể đắt hơn tính trên mỗi việc hoàn thành so với một mô hình đắt nhưng gọn. Thứ hai là tỷ lệ làm lại: một câu trả lời bạn phải tạo lại bị tính hai lần. Thứ ba là mọi thứ ngoài khoản tính phí token: hạn mức tốc độ, độ trễ, cửa sổ ngữ cảnh, khả năng dùng ở khu vực của bạn, và mô hình có đọc được các định dạng tệp bạn đang làm hay không.

Cách dùng trung thực một bài so sánh như bài này là coi nó như một cái lọc danh sách ngắn. Loại các hàng rõ ràng nằm ngoài ngân sách của bạn, thử hai hoặc ba ứng viên trên việc thật của mình, rồi nhìn một việc đã xong tốn bao nhiêu chứ không phải một triệu token tốn bao nhiêu. Ước tính từng tin nhắn khiến thí nghiệm này chỉ tốn một ngày, chứ không phải trọn một chu kỳ hóa đơn.

Câu hỏi thường gặp

Một tin nhắn tới API của LLM thực sự tốn bao nhiêu?
Nó phụ thuộc vào bốn khoản tính phí, không phải một: token bạn gửi, token mô hình viết lại, token đọc từ cache, và ở một số nhà cung cấp là token ghi vào cache. Một câu hỏi ngắn tới một mô hình giá giữa thường tốn một phần nhỏ của một xu, nhưng cùng câu hỏi đó ở cuối một luồng dài thì tốn hơn, vì cả cuộc trò chuyện được gửi lại làm đầu vào ở mỗi lượt.
Vì sao đầu ra đắt hơn đầu vào?
Sinh token là việc tuần tự và bị chặn bởi sức tính toán, còn việc đọc prompt thì không, nên nhà cung cấp đặt giá cao hơn. Trên 15 nhà cung cấp đo ngày 24 tháng 7 năm 2026, mô hình ở mức trung vị tính đầu ra đắt gấp bốn lần đầu vào, và khoảng một trên bảy tính hơn sáu lần. Xin câu trả lời ngắn hơn thường là đòn bẩy lớn hơn việc rút ngắn prompt.
Cache prompt có thực sự giảm hóa đơn không?
Có thể, khi cùng một ngữ cảnh dài được dùng lại vài lần. Khoảng một mô hình trên năm trong nguồn đã đo công bố giá đọc cache, và chỗ nào có thì nó nằm ở trung vị bằng 10% mức đầu vào của chính mô hình đó. Một số nhà cung cấp còn tính phí để ghi cache, nên cache một ngữ cảnh bạn chỉ dùng một lần có thể đắt hơn một chút so với không cache.
API trả theo mức dùng có rẻ hơn một gói thuê bao AI hằng tháng không?
Với mức dùng nhẹ hoặc không đều thì thường là có. Với mức dùng nặng đều mỗi ngày, một khoản phí cố định thường thắng. Không có một phần trăm chung, vì điểm cắt tùy lượng tin nhắn, độ dài câu trả lời và mô hình bạn chọn. Hãy ước tính một tuần điển hình bằng máy tính chi phí với giá hiện tại, thay vì tin một nhận định chung.
Vì sao cùng một mô hình có giá khác nhau trên các nền tảng khác nhau?
Hai lý do. Mô hình trọng số mở được nhiều máy chủ suy luận phục vụ, với phần cứng và biên lợi nhuận khác nhau, nên cùng một bộ trọng số có thể thực sự mang các mức giá khác nhau. Và các nền tảng bán lại quyền truy cập bọc thêm một lớp của riêng họ: một khoản chênh, một phí nạp, một phần trăm, hoặc một hệ credit. Câu cần hỏi là con đường từ giá niêm yết của nhà cung cấp tới số bạn bị tính có được công bố hay không.
Giá trong bài này còn mới tới đâu?
Mọi con số được lấy từ nguồn metadata sản xuất của Oriveo ngày 24 tháng 7 năm 2026, contract version 47, sinh lúc 2026-07-24T01:00:09Z. Giá của nhà cung cấp đổi thường, nên hãy coi các con số này là ảnh chụp của ngày đó. Máy tính chi phí trên trang đọc cùng nguồn đó theo thời gian thực, và đó là chỗ đúng để kiểm một mức giá hiện tại.
Oriveo có cộng thêm lên số nhà cung cấp tính không?
Không. Với API key của bạn, mỗi nhà cung cấp lập hóa đơn cho chính tài khoản của bạn theo giá niêm yết đã công bố, và Oriveo không lấy thêm gì. Mức dùng qua Oriveo AI tính theo giá niêm yết chính thức của từng mô hình, trừ từ số dư trả trước. Các gói Oriveo trả phí phủ tính năng phần mềm như đồng bộ giữa thiết bị và phân tích mức dùng. Chúng không gồm mức dùng AI hay credit mô hình.

Bài liên quan

Xem mỗi tin nhắn tốn bao nhiêu ngay khi bạn gửi

Oriveo hiện chi phí ước tính trên mỗi tin nhắn theo giá niêm yết của nhà cung cấp, qua 15 nhà cung cấp chính thức và 700+ mô hình, trên iPhone, Android và web, không cộng thêm lên mức dùng của nhà cung cấp.