Harga API LLM

Perbandingan biaya API AI: begini cara harga LLM bekerja

Dari apa harga API LLM sebenarnya tersusun, apa yang mendorong tagihanmu, dan rentang harga masukan serta keluaran yang nyata di 15 penyedia, diukur pada 24 Juli 2026.

Oriveo TeamDiterbitkan Diperbarui Baca 14 menit
  • API LLM menagih lewat hingga empat meter terpisah, dan sebagian besar perbandingan harga hanya melihat satu di antaranya.
  • Token keluaran berharga median empat kali token masukan, dan hingga dua belas kali.
  • Harga masukan yang diterbitkan di 15 penyedia merentang dari $0.01 sampai $150 per juta token per 24 Juli 2026.
Oriveo di iPhone: daftar chat, dengan perkiraan biaya tiap chat di sebelah kanan.

Bagaimana harga API LLM sebenarnya bekerja

Hampir setiap perbandingan biaya API AI mengutip satu angka per model, dan angka itu hampir selalu harga masukan. Itu yang paling tidak berguna di antara empat angka yang diterbitkan penyedia. Sebuah model menagih pada meter terpisah: token yang kamu kirim masuk, token yang ditulis balik oleh model, token yang dibaca dari cache, dan — pada sebagian penyedia — token yang ditulis ke cache itu. Tiap meter punya tarifnya sendiri, dan tarif-tarif itu tidak berdekatan.

Satu token kira-kira tiga perempat kata bahasa Inggris, jadi satu juta token berada di sekitar 750,000 kata. Harga dikutip per juta token karena satu pesan begitu murah, sampai harga per pesan hanya akan berisi nol. Cara mengutip seperti itu menyembunyikan betapa cepat meter-meter ini menumpuk dalam percakapan nyata, karena setiap giliran mengirim ulang semua yang sudah dikatakan sebelumnya.

Tabel di bawah menunjukkan keempat meter untuk segelintir model, diambil dari umpan metadata yang sama yang menggerakkan pemilih model dan kalkulator biaya di situs ini. Perhatikan betapa sedikit informasi dari kolom masukan: harga masukan di sini berkisar dari 0,30 sampai 2,50 dolar, sedangkan harga keluaran membentang dari 1,20 sampai 15,00 dolar, dan keluaran adalah meter yang paling menggerakkan tagihan.

  • Masukan — semua yang kamu kirim: pesanmu, percakapan sejauh ini, prompt sistem apa pun, teks lampiran apa pun.
  • Keluaran — semua yang ditulis balik model, termasuk token penalaran pada model yang menghasilkannya.
  • Baca masukan dari cache — konteks berulang yang sudah pernah dilihat penyedia, ditagih jauh lebih rendah daripada masukan baru.
  • Tulis cache — yang ditagih sebagian penyedia untuk menaruh konteks itu ke dalam cache pada awalnya.
Bagaimana harga API LLM sebenarnya bekerja
ModelMasukan (USD / 1 jt token)Keluaran (USD / 1 jt token)Baca masukan dari cacheTulis cache
Claude Haiku 4.51.005.000.101.25
Claude Sonnet 52.0010.000.202.50
GPT-5.6 Luna1.006.000.101.25
GPT-5.6 Terra2.5015.000.253.125
Kimi k2.50.603.000.100.60
Qwen3.7 Plus0.503.000.050.625
MiniMax-M2.50.301.200.030.375

Token keluaran adalah separuh yang mahal

Pola paling andal dalam harga LLM adalah menulis lebih mahal daripada membaca. Supaya ada angkanya, bukan hanya kesannya, kami mengambil setiap model teks di umpan metadata Oriveo yang menerbitkan harga per token — di seluruh 15 penyedia — lalu membandingkan tarif keluaran tiap model dengan tarif masukannya sendiri, per 24 Juli 2026.

Model pada median menagih keluaran tepat empat kali harga masukan. Sekitar satu dari sepuluh model menagih sama untuk keduanya, atau lebih murah untuk keluaran, yang khas pada model open-weight yang dilayani host inferensi. Di ujung lain, kira-kira satu dari tujuh menagih lebih dari enam kali, dan celah terlebar di umpan ini dua belas kali.

Ini langsung mengubah cara kamu berbelanja. Memangkas prompt adalah optimasi yang paling sering dicoba pertama kali, dan biasanya itu pengungkit yang lebih kecil. Meminta jawaban yang lebih pendek, membatasi panjang keluaran, atau memilih model yang tidak berpikir panjang-panjang akan menggeser tagihan lebih jauh daripada memotong satu paragraf dari pertanyaan. Model penalaran layak dilihat sekali lagi di sini, karena token berpikir yang mereka hasilkan ditagih sebagai keluaran meskipun kamu tidak pernah melihatnya.

Token keluaran adalah separuh yang mahal
Harga keluaran dibanding harga masukanPorsi model teks yang dihargai
Sama atau lebih murah (1× atau kurang)10%
1× sampai 2×11%
2× sampai 4×39%
4× sampai 6×25%
Lebih dari 6×15%

Apa yang sebenarnya mendorong tagihanmu

Tagihan API pertama biasanya mengejutkan karena salah satu dari empat alasan, dan tidak satu pun adalah harga judul modelnya. Mekanisme di bawah berlaku untuk setiap penyedia, karena mengikuti cara API chat bekerja, bukan kebijakan vendor mana pun.

Yang terbesar adalah pengiriman ulang konteks. Panggilan API tidak menyimpan keadaan: model tidak ingat giliran sebelumnya, jadi klien harus mengirim ulang seluruh percakapan pada setiap pesan. Utas yang sudah berjalan empat puluh giliran mengirim empat puluh giliran riwayat sebagai masukan pada giliran keempat puluh satu. Karena itu biaya sebuah percakapan tumbuh kira-kira mengikuti kuadrat panjangnya, dan itulah sebabnya satu utas panjang bisa lebih mahal daripada dua puluh utas pendek yang membahas hal yang sama.

Cache prompt adalah penyeimbangnya, dan layak dipahami sebelum kamu mengabaikannya. Penyedia yang mendukungnya menagih konteks yang berulang sebagai pembacaan cache, bukan sebagai masukan baru. Di umpan yang kami ukur, sekitar satu dari lima model menerbitkan harga baca cache, dan bila ada, tarif cache itu berada pada median 10% dari harga masukan model itu sendiri — yang terendah kami temukan di bawah 1%, yang tertinggi sekitar 58%. Sebagian penyedia juga menagih penulisan cache, biasanya lebih mahal daripada masukan biasa, jadi caching baru menguntungkan jika konteks yang sama dipakai ulang beberapa kali, dan tidak jika hanya dipakai sekali.

  • Riwayat percakapan — dikirim ulang utuh di setiap giliran, jadi utas panjang biayanya naik tidak proporsional.
  • Prompt sistem dan preset — instruksi yang bisa dipakai ulang diletakkan di depan setiap pesan, diam-diam memperbesar jumlah tokennya.
  • Lampiran — dokumen atau gambar yang dimasukkan ke obrolan menjadi token masukan, dan tetap berada di konteks untuk setiap giliran berikutnya di utas itu.
  • Token penalaran — ditagih sebagai keluaran pada model yang menghasilkannya, baik penalarannya ditampilkan atau tidak.
  • Percobaan ulang dan regenerasi — jawaban yang dibuat ulang adalah permintaan penuh kedua yang ditagih, bukan koreksi gratis.

Peta harga di 15 penyedia

Tabel di bawah adalah potret rentang harga masukan yang diterbitkan di masing-masing 15 penyedia yang dihubungkan Oriveo. Tabel ini hanya menghitung model teks yang menerbitkan harga per token, dan menunjukkan yang termurah serta yang termahal di penyedia itu. Ini peta posisi tiap penyedia, bukan rekomendasi: model termurah di suatu penyedia dan yang termahal jarang bisa saling menggantikan.

Sumber dan metodenya, supaya kamu bisa mengecek: setiap angka berasal dari umpan metadata produksi Oriveo di api.oriveoai.com/api/metadata, versi kontrak 47, dibuat 2026-07-24T01:00:09Z — umpan yang sama yang dipakai aplikasi untuk memberi harga pesan, dan yang sama di balik kalkulator biaya di situs ini. Harga dalam dolar AS per juta token, per 24 Juli 2026. Model pembuatan gambar dan model yang dihargai penyedia per permintaan, bukan per token, dikeluarkan, karena angka per token tidak akan berarti untuk mereka.

Dua hal menonjol. Pertama, sebarannya: harga masukan termurah di seluruh umpan adalah $0.01 per juta token dan yang termahal $150, faktor lima belas ribu antara dua baris di pemilih yang sama per 24 Juli 2026. Kedua, keluasan katalog dan kemurahan adalah sumbu yang berbeda — agregator membawa rentang terlebar karena mereka menjual kembali banyak vendor, sementara penyedia tunggal mengelompok rapat di sekitar tingkatan mereka sendiri.

Perlakukan setiap angka di sini sebagai mudah kedaluwarsa. Penyedia mengubah harga, meluncurkan tingkat yang lebih murah, dan memensiunkan model terus-menerus; beberapa baris di bawah berubah dalam kuartal terakhir. Artikel apa pun yang mengutip harga model adalah foto, dan itulah sebabnya umpan langsung serta kalkulator ada, dan halaman ini menyatakan tanggal pengambilannya alih-alih menyiratkan angkanya permanen.

Peta harga di 15 penyedia
PenyediaModel teks dengan harga token yang diterbitkanMasukan terendah (USD / 1 jt)Masukan tertinggi (USD / 1 jt)
OpenAI490.05150
Anthropic (Claude)101.0015
Google Gemini210.0752.00
xAI Grok61.002.00
DeepSeek40.140.435
Mistral320.042.00
Qwen490.0352.80
Kimi90.202.00
MiniMax70.300.60
Z.ai120.071.40
Groq70.030.59
Together AI690.023.50
Fireworks AI150.072.80
OpenRouter3050.01150
SiliconFlow490.041.74

Mengapa model yang sama punya lebih dari satu harga

Buka dua direktori model dan kamu akan menemukan model yang sama tercantum pada tarif berbeda. Itu biasanya bukan kesalahan. Model open-weight dilayani beberapa host inferensi, masing-masing dengan perangkat keras, throughput, dan margin sendiri, jadi sebuah model sah-sah saja berharga sekian di satu host dan lain di host lain. Di umpan di atas, keluarga open-weight yang sama muncul di beberapa penyedia pada tarif yang benar-benar berbeda.

Alasan kedua adalah lapisan tempat kamu membeli. Agregator duduk di antara kamu dan penyedia di baliknya, dan harus membiayai posisi itu dengan suatu cara — lewat selisih pada harga token, biaya pengisian, persentase pada permintaan, atau sistem kredit yang konversinya ke token ditentukan platform, bukan daftar harga penyedia. Tidak satu pun dari itu buruk dengan sendirinya; yang penting adalah apakah mekanismenya diterbitkan. OpenRouter, misalnya, mendokumentasikan ketentuannya secara terbuka: per 24 Juli 2026, kebijakan yang diterbitkan adalah biaya 5.5% pada pengisian kartu dengan minimum $0.80, dan untuk key yang kamu bawa sendiri, satu juta permintaan pertama tiap bulan tanpa biaya, dengan 5% dari harga normal model dipotong dalam kredit di atas itu.

Ketika kamu membandingkan platform, pertanyaan yang layak diajukan bukan “berapa harga satu kredit”, melainkan “apa rute yang diterbitkan dari harga daftar penyedia ke apa yang ditagihkan kepadamu”. Jika sebuah platform memberi harga dalam kredit dan tidak menerbitkan konversi itu, perbandingan yang kamu buat bukan dengan harga model — melainkan dengan kebijakan harga platform, dan kebijakan itu bisa berubah tanpa harga model berubah sama sekali.

Langganan atau bayar sesuai pemakaian: mana yang lebih murah untukmu

Inilah pertanyaan yang sebenarnya dibawa kebanyakan orang, dan tidak ada jawaban umum. Langganan bulanan tetap dan akses API yang diukur bersilangan pada suatu volume pemakaian, dan titik silang itu bergantung pada pesanmu sendiri: seberapa panjang pesannya, seberapa panjang jawabannya, model mana yang kamu pilih, dan seberapa panjang utasnya berjalan. Siapa pun yang mengutip persentase penghematan tanpa angkamu sedang menebak.

Kamu bisa menghitungnya dalam kira-kira lima menit, dan hitungannya tidak sulit. Ambil pekan yang benar-benar tipikal, bukan yang tersibuk. Hitung pesannya. Perkirakan panjang rata-rata jawaban yang kamu dapat dalam kata, lalu kalikan kira-kira 1.35 untuk mendapat token. Tambahkan sisi masukan, ingat bahwa setiap giliran mengirim ulang utas sejauh ini. Kalikan dengan tarif masukan dan keluaran yang diterbitkan model, lalu bandingkan dengan biaya bulanan yang sedang kamu pertimbangkan. Kalkulator biaya di situs ini menghitungnya dari harga yang sedang berlaku, sehingga kamu tidak harus menyimpan tarifnya sendiri.

Beberapa pola struktural cukup stabil untuk dinyatakan tanpa mengarang angka. Akses yang diukur cenderung menang ketika pemakaian ringan atau melonjak, ketika kamu memakai beberapa model sesekali alih-alih satu secara berat, dan ketika sebagian besar pekerjaanmu adalah pertanyaan pendek dengan jawaban pendek. Langganan cenderung menang pada volume harian yang konsisten tinggi, dan punya keuntungan nonfinansial yang nyata: tagihan yang bisa diprediksi. Akses yang diukur tanpa keterlihatan biaya per pesan adalah yang terburuk dari keduanya, dan persis itulah kegagalan yang hendak dicegah estimasi biaya pada tiap pesan.

Bagaimana benar-benar mengurangi yang kamu belanjakan

Begitu meter-meternya terlihat, sebagian besar penghematan datang dari sejumlah kecil kebiasaan, bukan dari berburu penyedia termurah. Kira-kira menurut seberapa jauh mereka menggerakkan angka, untuk beban obrolan yang tipikal:

Yang biasanya tidak berhasil adalah memindahkan semuanya ke model termurah di katalog. Model yang butuh tiga percobaan untuk mendapat jawaban yang benar pada seperlima harga bukan penghematan, dan itu juga menghabiskan waktumu. Versi yang berguna dari saran ini adalah mencocokkan model dengan tugas — model murah untuk ekstraksi, pemformatan, ringkasan, dan penerjemahan; yang mahal untuk pekerjaan yang tadinya kamu bayar orang untuk mengerjakannya.

  • Mulai percakapan baru untuk topik baru. Ini pengungkit terbesar, karena itu menghentikanmu membayar untuk mengirim ulang riwayat yang tidak relevan.
  • Minta jawaban yang lebih pendek ketika kamu memang ingin jawaban yang lebih pendek. Keluaran adalah meter yang lebih mahal pada sekitar sembilan dari sepuluh model.
  • Cocokkan model dengan tugas, alih-alih selalu memakai yang terkuat untuk segalanya.
  • Jaga prompt sistem dan preset yang bisa dipakai ulang tetap ringkas — mereka ditagih pada setiap pesan yang memakainya.
  • Pakai cache prompt di tempat penyedia mendukungnya dan kamu memakai ulang konteks panjang yang sama berulang kali.
  • Keluarkan lampiran dari utas begitu kamu selesai dengannya, alih-alih membawanya di setiap giliran berikutnya.
  • Cek estimasi pada sebuah pesan sebelum mengulang pola itu seratus kali.

Bagaimana Oriveo menampilkan biayanya

Setiap pesan di Oriveo membawa estimasi biaya, dihitung dari harga token yang diterbitkan penyedia dan token yang benar-benar dilaporkan, pada saat jawaban selesai. Estimasi itu tersedia di setiap tingkat, termasuk yang tanpa akun, karena biaya yang hanya bisa dilihat di paket berbayar tidak membantumu memutuskan apakah perlu membayar apa pun. Umpan metadata yang sama yang dipakai di tabel di atas yang memasok harga-harga itu, dan itulah sebabnya aplikasi tidak mengharuskanmu memelihara daftar harga.

Itu estimasi, dan diberi label sebagai estimasi. Penyedia menerapkan pembulatan, satuan tertagih minimum, tarif per akun, dan harga promosi sesekali mereka sendiri, dan jumlah token dilaporkan penyedia setelah kejadian. Estimasi ada untuk mengarahkan keputusan selama bulan berjalan; tagihan penyedia adalah keputusan akhir, dan ketika keduanya tidak sepakat, tagihanlah yang benar.

Analisis yang lebih dalam berada di balik paket berbayar. Usage Insights — pengeluaran dipecah per penyedia dan model, tren bulanan, dan peringatan anggaran — adalah bagian Pro dan Lifetime, yang berharga $9.99 sebulan, $59.99 setahun, atau $149.99 sekali bayar per 24 Juli 2026. Paket itu membeli fitur perangkat lunak saja: tidak mencakup pemakaian AI, kredit model, atau langganan penyedia, jadi harga aplikasi dan harga tokenmu tidak pernah digabung menjadi satu angka yang tidak bisa kamu uraikan.

Layar analitik pemakaian yang memecah pengeluaran AI per penyedia dan model
Estimasi per pesan tersedia di setiap tingkat; rincian per penyedia dan model adalah bagian paket berbayar.

Apa yang tidak bisa diberitahukan angka-angka ini

Tabel harga adalah titik awal, bukan keputusan. Tiga hal yang tidak tercakup di dalamnya layak dikatakan terus terang, karena ketiganya rutin membalik perbandingan yang tampak selesai dari harga saja.

Yang pertama adalah token per tugas. Dua model pada tarif yang sama bisa berbeda jauh dalam berapa banyak token yang mereka habiskan untuk mencapai jawaban yang sama, dan model murah yang bertele-tele bisa lebih mahal per pekerjaan selesai daripada model mahal yang ringkas. Yang kedua adalah tingkat percobaan ulang: jawaban yang harus kamu buat ulang ditagih dua kali. Yang ketiga adalah segala sesuatu di luar meter token — batas laju, latensi, jendela konteks, ketersediaan di wilayahmu, dan apakah model bisa membaca format berkas yang kamu pakai.

Cara jujur memakai perbandingan seperti ini adalah sebagai saringan daftar pendek. Singkirkan baris yang jelas di luar anggaranmu, coba dua atau tiga kandidat pada pekerjaan nyatamu, dan lihat berapa biaya tugas yang selesai, bukan berapa biaya satu juta token. Estimasi per pesan ada persis agar eksperimen ini memakan waktu sehari, bukan satu siklus tagihan.

Pertanyaan yang sering diajukan

Berapa biaya satu pesan ke API LLM sebenarnya?
Itu bergantung pada empat meter, bukan satu: token yang kamu kirim, token yang ditulis balik model, token yang dibaca dari cache, dan pada sebagian penyedia token yang ditulis ke cache. Pertanyaan pendek ke model berharga menengah biasanya memakan sepersekian sen, tetapi pertanyaan yang sama di ujung utas panjang memakan lebih banyak, karena seluruh percakapan dikirim ulang sebagai masukan di setiap giliran.
Mengapa keluaran lebih mahal daripada masukan?
Menghasilkan token bersifat berurutan dan terikat komputasi, dengan cara yang tidak berlaku saat membaca prompt, jadi penyedia memberi harganya lebih tinggi. Di 15 penyedia yang diukur pada 24 Juli 2026, model median menagih empat kali lebih mahal untuk keluaran daripada masukan, dan sekitar satu dari tujuh menagih lebih dari enam kali. Meminta jawaban yang lebih pendek biasanya pengungkit yang lebih besar daripada memendekkan promptmu.
Apakah cache prompt benar-benar mengurangi tagihan?
Bisa, ketika konteks panjang yang sama dipakai ulang beberapa kali. Sekitar satu dari lima model di umpan yang diukur menerbitkan harga baca cache, dan bila ada, angkanya berada pada median 10% dari tarif masukan model itu sendiri. Sebagian penyedia juga menagih penulisan cache, jadi memasukkan konteks yang hanya kamu pakai sekali ke cache bisa sedikit lebih mahal daripada tidak memasukkannya sama sekali.
Apakah API bayar sesuai pemakaian lebih murah daripada langganan AI bulanan?
Untuk pemakaian yang ringan atau tidak merata, biasanya ya; untuk pemakaian harian yang konsisten berat, biaya tetap sering menang. Tidak ada persentase universal, karena titik silang bergantung pada volume pesanmu, panjang jawaban, dan pilihan model. Perkirakan pekan yang tipikal dengan kalkulator biaya terhadap harga saat ini, alih-alih memercayai klaim umum.
Mengapa model yang sama berharga berbeda di platform yang berbeda?
Dua alasan. Model open-weight dilayani beberapa host inferensi dengan perangkat keras dan margin berbeda, jadi bobot yang identik benar-benar bisa membawa tarif berbeda. Dan platform yang menjual kembali akses menambahkan lapisan sendiri — selisih, biaya pengisian, persentase, atau sistem kredit. Pertanyaan yang perlu diajukan adalah apakah rute dari harga daftar penyedia ke tagihanmu diterbitkan.
Seberapa mutakhir harga dalam artikel ini?
Setiap angka diambil dari umpan metadata produksi Oriveo pada 24 Juli 2026, versi kontrak 47, dibuat pada 2026-07-24T01:00:09Z. Harga penyedia sering berubah, jadi perlakukan angka ini sebagai potret tanggal itu. Kalkulator biaya di situs membaca umpan yang sama secara langsung, dan itulah tempat yang tepat untuk mengecek tarif yang berlaku.
Apakah Oriveo menambah markup di atas yang ditagih penyedia?
Tidak. Dengan API key milikmu, tiap penyedia menagih akunmu pada harga daftar yang diterbitkan dan Oriveo tidak mengambil apa pun di atasnya. Pemakaian terkelola ditagih pada harga daftar resmi tiap model dari saldo prabayar. Paket Oriveo berbayar mencakup fitur perangkat lunak seperti sinkronisasi lintas perangkat dan analitik pemakaian; mereka tidak mencakup pemakaian AI atau kredit model.

Bacaan terkait

Lihat berapa biaya tiap pesan saat kamu mengirimnya

Oriveo menampilkan estimasi biaya pada setiap pesan pada harga daftar penyedia, di 15 penyedia resmi dan 700+ model, di iPhone, Android, dan web — tanpa markup pada pemakaian penyedia.