LLM API 요금

AI API 비용 비교: LLM 요금은 실제로 어떻게 매겨지나

LLM API 요금이 무엇으로 구성되는지, 청구액을 키우는 요인은 무엇인지, 제공업체 15곳의 실제 입력·출력 가격 범위를 2026년 7월 24일 기준으로 정리했습니다.

Oriveo Team게시일 수정일 약 12분
  • LLM API 요금은 최대 네 가지 항목으로 따로 계산되는데, 가격 비교 글 대부분은 그중 하나만 봅니다.
  • 출력 토큰 가격은 입력 토큰 가격의 중앙값 4배이며, 최대 12배에 이릅니다.
  • 2026년 7월 24일 기준 제공업체 15곳이 공개한 입력 가격은 100만 토큰당 $0.01부터 $150까지입니다.
iPhone용 Oriveo의 대화 목록. 각 대화 오른쪽에 예상 비용이 표시됩니다.

LLM API 요금은 실제로 어떻게 계산되나

AI API 비용 비교 글은 대부분 모델마다 숫자 하나만 제시하고, 그 숫자는 거의 언제나 입력 가격입니다. 하지만 제공업체가 공개하는 네 가지 숫자 중 가장 쓸모가 적은 숫자입니다. 모델 요금은 여러 항목으로 나뉘어 계산됩니다. 보내는 토큰, 모델이 생성하는 토큰, 캐시에서 읽는 토큰, 그리고 일부 제공업체에서는 캐시에 쓰는 토큰까지입니다. 항목마다 요율이 다르고, 그 차이도 큽니다.

토큰 하나는 영어 단어 약 4분의 3에 해당하므로, 100만 토큰은 대략 75만 단어입니다. 가격을 100만 토큰 단위로 표시하는 이유는 메시지 하나의 비용이 너무 작아 메시지 단위로 적으면 0만 늘어서기 때문입니다. 그런데 이 표기 방식은 실제 대화에서 비용이 얼마나 빨리 쌓이는지를 가립니다. 대화에서는 매번 앞선 내용 전체를 다시 보내기 때문입니다.

아래 표는 몇몇 모델의 네 가지 요금 항목을 보여 줍니다. 이 사이트의 모델 선택기와 비용 계산기에 쓰이는 것과 같은 메타데이터 피드에서 가져온 값입니다. 입력 가격 열만으로는 알 수 있는 것이 거의 없다는 점에 주목해 보세요. 이 표에서 입력 가격은 0.30~2.50달러인데 출력 가격은 1.20~15.00달러까지 벌어지고, 청구액을 가장 크게 움직이는 것은 바로 출력입니다.

  • 입력: 보내는 모든 것. 내 메시지, 지금까지의 대화, 시스템 프롬프트, 첨부한 텍스트가 모두 포함됩니다.
  • 출력: 모델이 생성하는 모든 것. 추론 토큰을 생성하는 모델이라면 추론 토큰도 포함됩니다.
  • 캐시 입력 읽기: 제공업체가 이미 받은 적 있는 반복 맥락. 새 입력보다 훨씬 낮은 요율로 청구됩니다.
  • 캐시 쓰기: 그 맥락을 처음 캐시에 넣을 때 일부 제공업체가 청구하는 요금.
LLM API 요금은 실제로 어떻게 계산되나
모델입력(USD / 100만 토큰)출력(USD / 100만 토큰)캐시 입력 읽기캐시 쓰기
Claude Haiku 4.51.005.000.101.25
Claude Sonnet 52.0010.000.202.50
GPT-5.6 Luna1.006.000.101.25
GPT-5.6 Terra2.5015.000.253.125
Kimi k2.50.603.000.100.60
Qwen3.7 Plus0.503.000.050.625
MiniMax-M2.50.301.200.030.375

비싼 쪽은 출력 토큰입니다

LLM 요금에서 가장 확실한 규칙은 쓰기가 읽기보다 비싸다는 것입니다. 인상이 아니라 숫자로 확인하기 위해, 2026년 7월 24일 기준 Oriveo 메타데이터 피드에서 토큰당 가격을 공개한 텍스트 모델 전부(제공업체 15곳 전체)를 대상으로 모델별 출력 요율을 해당 모델의 입력 요율과 비교했습니다.

중앙값에 해당하는 모델은 출력에 입력의 정확히 4배를 받습니다. 약 10곳 중 1곳의 모델은 출력과 입력 가격이 같거나 출력이 더 싼데, 추론 호스팅 업체가 제공하는 오픈 웨이트 모델에서 흔한 경우입니다. 반대쪽 끝에서는 약 7곳 중 1곳이 6배 넘게 받으며, 피드에서 가장 큰 차이는 12배였습니다.

이는 비용을 쓰는 방식에 직접 영향을 줍니다. 누구나 가장 먼저 떠올리는 절약법은 프롬프트 줄이기지만, 대개 효과가 더 작은 쪽입니다. 짧은 답변을 요청하거나, 출력 길이를 제한하거나, 길게 생각을 늘어놓지 않는 모델을 고르는 편이 질문에서 한 문단을 덜어 내는 것보다 청구액을 더 크게 줄입니다. 추론 모델은 특히 다시 살펴볼 만합니다. 추론 과정에서 생성하는 토큰은 화면에 보이지 않아도 출력으로 청구되기 때문입니다.

비싼 쪽은 출력 토큰입니다
입력 가격 대비 출력 가격가격이 공개된 텍스트 모델 비율
같거나 더 저렴함(1배 이하)10%
1배~2배11%
2배~4배39%
4배~6배25%
6배 초과15%

청구액을 실제로 키우는 요인

첫 API 청구서를 보고 놀라는 이유는 대개 네 가지 중 하나이며, 모델의 대표 가격은 그 이유가 아닙니다. 아래 원리는 특정 회사의 정책이 아니라 채팅 API의 동작 방식에서 비롯되므로 모든 제공업체에 똑같이 적용됩니다.

가장 큰 요인은 맥락 재전송입니다. API 호출은 상태를 기억하지 않습니다. 모델은 직전 대화를 기억하지 못하므로, 클라이언트가 메시지를 보낼 때마다 대화 전체를 다시 보내야 합니다. 40번 주고받은 대화라면 41번째 메시지에서 40번 분량의 기록을 입력으로 보냅니다. 그래서 대화 비용은 대략 길이의 제곱에 비례해 늘어나고, 긴 대화 하나가 같은 내용을 다룬 짧은 대화 스무 개보다 비쌀 수 있습니다.

이를 상쇄하는 것이 프롬프트 캐싱이며, 무시하기 전에 이해해 둘 가치가 있습니다. 캐싱을 지원하는 제공업체에서는 반복되는 맥락을 새 입력이 아니라 캐시 읽기로 청구합니다. 저희가 조사한 피드에서는 약 5곳 중 1곳의 모델이 캐시 읽기 가격을 공개했고, 공개한 경우 캐시 요율은 해당 모델 입력 가격의 중앙값 10%였습니다. 가장 낮은 것은 1% 미만, 가장 높은 것은 약 58%였습니다. 일부 제공업체는 캐시 쓰기에도 요금을 매기며 대개 일반 입력보다 비쌉니다. 따라서 캐싱은 같은 맥락을 여러 번 재사용할 때 이득이고, 한 번만 쓸 때는 이득이 없습니다.

  • 대화 기록: 매번 전체가 다시 전송되므로 긴 대화일수록 비용이 불균형하게 커집니다.
  • 시스템 프롬프트와 프리셋: 재사용하는 지시문은 모든 메시지 앞에 붙어서, 모르는 사이에 토큰 수를 몇 배로 늘립니다.
  • 첨부 파일: 대화에 넣은 문서나 이미지는 입력 토큰이 되고, 그 대화의 이후 모든 메시지에서 맥락에 계속 남습니다.
  • 추론 토큰: 추론 토큰을 생성하는 모델에서는 화면에 표시되든 아니든 출력으로 청구됩니다.
  • 재시도와 다시 생성: 다시 생성한 답변은 무료 수정이 아니라 또 한 번의 온전한 유료 요청입니다.

제공업체 15곳의 가격 분포

아래 표는 Oriveo가 연결하는 제공업체 15곳 각각의 공개 입력 가격 범위를 보여 주는 스냅숏입니다. 토큰당 가격을 공개한 텍스트 모델만 집계했고, 제공업체별로 가장 저렴한 모델과 가장 비싼 모델의 가격을 적었습니다. 각 제공업체가 어디쯤에 있는지 보여 주는 지도일 뿐 추천이 아닙니다. 한 제공업체의 가장 싼 모델과 가장 비싼 모델은 서로 대체재인 경우가 드뭅니다.

직접 검증할 수 있도록 출처와 방법을 밝힙니다. 모든 수치는 Oriveo의 프로덕션 메타데이터 피드(api.oriveoai.com/api/metadata, contract 버전 47, 2026-07-24T01:00:09Z 생성)에서 가져왔습니다. 앱이 메시지 비용을 계산할 때 쓰는 피드이자, 이 사이트의 비용 계산기가 쓰는 피드와 같습니다. 가격은 2026년 7월 24일 기준 100만 토큰당 미국 달러입니다. 이미지 생성 모델과 토큰이 아니라 요청 단위로 가격을 매기는 모델은 제외했습니다. 이런 모델에는 토큰당 가격이 의미가 없기 때문입니다.

눈에 띄는 점이 두 가지 있습니다. 첫째는 편차입니다. 2026년 7월 24일 기준 피드 전체에서 가장 싼 입력 가격은 100만 토큰당 $0.01, 가장 비싼 것은 $150으로, 같은 선택기 안의 두 모델 사이에 1만 5천 배 차이가 납니다. 둘째, 카탈로그의 폭과 저렴함은 서로 다른 축입니다. 애그리게이터는 여러 회사의 모델을 되팔기 때문에 가격 범위가 가장 넓고, 한 회사의 모델만 제공하는 제공업체는 자체 등급 체계를 중심으로 가격이 촘촘하게 모여 있습니다.

여기 나온 숫자는 모두 금방 바뀐다고 생각하면 됩니다. 제공업체는 수시로 가격을 조정하고, 더 저렴한 등급을 내놓고, 모델을 종료합니다. 아래 표의 여러 항목도 지난 분기에 바뀌었습니다. 모델 가격을 인용하는 글은 모두 특정 시점의 사진일 뿐입니다. 그래서 실시간 피드와 계산기가 따로 있고, 이 페이지도 숫자가 영원하다고 암시하는 대신 수집 날짜를 밝힙니다.

제공업체 15곳의 가격 분포
제공업체토큰 가격이 공개된 텍스트 모델 수최저 입력(USD / 100만)최고 입력(USD / 100만)
OpenAI490.05150
Anthropic (Claude)101.0015
Google Gemini210.0752.00
xAI Grok61.002.00
DeepSeek40.140.435
Mistral320.042.00
Qwen490.0352.80
Kimi90.202.00
MiniMax70.300.60
Z.ai120.071.40
Groq70.030.59
Together AI690.023.50
Fireworks AI150.072.80
OpenRouter3050.01150
SiliconFlow490.041.74

같은 모델인데 가격이 여러 개인 이유

모델 목록 두 곳을 열어 보면 같은 모델이 서로 다른 가격으로 올라 있는 경우가 있습니다. 대개 오류가 아닙니다. 오픈 웨이트 모델은 여러 추론 호스팅 업체가 제공하고, 업체마다 하드웨어, 처리량, 마진이 다르기 때문에 같은 모델이라도 업체에 따라 가격이 다를 수 있습니다. 위 피드에서도 같은 오픈 웨이트 모델 계열이 여러 제공업체에서 실제로 서로 다른 요율로 제공됩니다.

두 번째 이유는 어떤 계층을 거쳐 구매하느냐입니다. 애그리게이터는 사용자와 실제 제공업체 사이에 있고, 그 역할의 비용을 어떤 식으로든 충당해야 합니다. 토큰 가격에 붙는 차익, 충전 수수료, 요청당 일정 비율, 또는 제공업체 가격표가 아니라 플랫폼이 환산 비율을 정하는 크레딧 제도 등이 그 방법입니다. 어느 것도 그 자체로 나쁘지는 않습니다. 중요한 것은 그 방식이 공개되어 있느냐입니다. 예를 들어 OpenRouter는 조건을 공개적으로 문서화합니다. 2026년 7월 24일 기준 공개 정책에 따르면 카드 충전 시 5.5%(최소 $0.80)의 수수료가 붙고, 본인 API 키로 보내는 요청은 매달 처음 100만 건까지 무료이며 그 이후에는 모델 정가의 5%를 크레딧에서 차감합니다.

플랫폼을 비교할 때 물어야 할 질문은 ‘크레딧 하나가 얼마인가’가 아니라 ‘제공업체 공개 정가에서 내가 실제로 내는 금액까지 어떤 경로로 계산되는지 공개되어 있는가’입니다. 크레딧으로 가격을 매기면서 환산 비율을 공개하지 않는 플랫폼이라면, 비교하는 대상은 모델 가격이 아니라 그 플랫폼의 가격 정책입니다. 그리고 그 정책은 모델 가격이 그대로여도 얼마든지 바뀔 수 있습니다.

구독과 종량제, 나에게는 어느 쪽이 저렴한가

대부분의 사람이 실제로 궁금해하는 질문이지만, 모두에게 통하는 답은 없습니다. 월정액 구독과 종량제 API는 어느 사용량에서 비용이 역전되는데, 그 지점은 내 메시지에 달려 있습니다. 메시지 길이, 답변 길이, 고르는 모델, 대화가 이어지는 길이에 따라 달라집니다. 내 숫자 없이 몇 퍼센트 절약된다고 말하는 사람은 추측하고 있는 것입니다.

계산은 5분 정도면 충분하고 어렵지 않습니다. 가장 바빴던 주가 아니라 평범한 한 주를 기준으로 삼으세요. 메시지 수를 세고, 받는 답변의 평균 길이를 영어 단어 수로 어림한 뒤 약 1.35를 곱해 토큰 수로 바꿉니다. 여기에 입력 쪽을 더하는데, 매번 지금까지의 대화가 다시 전송된다는 점을 잊지 마세요. 이를 모델의 공개 입력·출력 요율로 곱한 뒤 고려 중인 월 구독료와 비교하면 됩니다. 이 사이트의 비용 계산기는 실시간 가격으로 이 계산을 해 주므로 요율을 직접 챙길 필요가 없습니다.

숫자를 지어내지 않고도 말할 수 있을 만큼 안정적인 경향은 있습니다. 종량제는 사용량이 적거나 들쭉날쭉할 때, 모델 하나를 많이 쓰기보다 여러 모델을 가끔 쓸 때, 짧은 질문과 짧은 답변이 대부분일 때 유리한 편입니다. 구독은 매일 꾸준히 많이 쓸 때 유리한 편이고, 청구액을 예측할 수 있다는 돈 이외의 장점도 분명히 있습니다. 메시지별 비용을 볼 수 없는 종량제는 두 방식의 단점만 모은 셈이며, 메시지마다 예상 비용을 표시하는 이유가 바로 이것을 막기 위해서입니다.

실제로 비용을 줄이는 방법

요금 항목이 보이기 시작하면, 절약의 대부분은 가장 싼 제공업체를 찾아다니는 것이 아니라 몇 가지 습관에서 나옵니다. 일반적인 채팅 사용 기준으로, 효과가 큰 순서대로 대략 정리하면 다음과 같습니다.

반대로 대개 효과가 없는 것은 모든 작업을 카탈로그에서 가장 싼 모델로 바꾸는 것입니다. 가격이 5분의 1이어도 제대로 된 답을 얻기까지 세 번 시도해야 하는 모델이라면 절약이 아니고, 시간까지 잃습니다. 이 조언을 쓸모 있게 바꾸면 작업에 맞는 모델을 고르라는 것입니다. 추출, 서식 정리, 요약, 번역에는 저렴한 모델을, 사람에게 맡겼다면 돈을 냈을 작업에는 비싼 모델을 쓰세요.

  • 주제가 바뀌면 새 대화를 시작합니다. 관련 없는 기록을 다시 보내는 비용을 막아 주므로 효과가 가장 큽니다.
  • 짧은 답이 필요하면 짧게 답해 달라고 요청합니다. 약 10개 중 9개 모델에서 출력이 더 비싼 항목입니다.
  • 모든 일에 가장 강력한 모델을 쓰는 대신 작업에 맞는 모델을 고릅니다.
  • 시스템 프롬프트와 재사용 프리셋은 간결하게 유지합니다. 이를 쓰는 모든 메시지에 요금이 붙습니다.
  • 제공업체가 지원하고 같은 긴 맥락을 반복해서 쓴다면 프롬프트 캐싱을 활용합니다.
  • 다 쓴 첨부 파일은 이후 메시지에 계속 끌고 가지 말고 대화에서 제거합니다.
  • 같은 방식을 백 번 반복하기 전에 메시지의 예상 비용을 먼저 확인합니다.

Oriveo가 비용을 보여 주는 방식

Oriveo에서는 답변이 끝나는 즉시 모든 메시지에 예상 비용이 표시됩니다. 제공업체가 공개한 토큰 가격과 실제로 보고된 토큰으로 계산합니다. 로그인 없이 쓰는 티어를 포함해 모든 티어에서 볼 수 있습니다. 유료 요금제에서만 보이는 비용 정보로는 유료 결제를 할지 말지 판단하는 데 도움이 되지 않기 때문입니다. 위 표에 쓴 것과 같은 메타데이터 피드가 이 가격을 제공하므로, 사용자가 가격표를 따로 관리할 필요가 없습니다.

이 값은 예상치이며 앱에서도 예상치로 표시합니다. 제공업체는 자체 반올림, 최소 청구 단위, 계정별 요율, 때때로 프로모션 가격을 적용하고, 토큰 수도 사후에 보고합니다. 예상 비용은 한 달 동안 의사 결정의 방향을 잡기 위한 것이며, 최종 금액은 제공업체의 청구서를 따릅니다. 둘이 다르면 청구서가 맞습니다.

더 깊은 분석은 유료 요금제에 포함됩니다. 제공업체·모델별 지출, 월별 추이, 예산 알림을 보여 주는 Usage Insights는 Pro와 Lifetime에 포함되며, 2026년 7월 24일 기준 가격은 월 $9.99, 연 $59.99, 또는 1회 $149.99입니다. 이 요금제는 소프트웨어 기능에 대한 것입니다. AI 사용료, 모델 크레딧, 제공업체 구독은 포함되지 않으므로 앱 가격과 토큰 비용이 따로 떼어 볼 수 없는 숫자 하나로 묶이지 않습니다.

AI 지출을 제공업체와 모델별로 나누어 보여 주는 사용량 분석 화면
메시지별 예상 비용은 모든 티어에서 볼 수 있고, 제공업체·모델별 분석은 유료 요금제에 포함됩니다.

이 숫자들이 알려 주지 않는 것

가격표는 출발점이지 결론이 아닙니다. 가격표에 빠진 세 가지를 분명히 짚어 둡니다. 가격만 보고 끝난 것 같던 비교를 뒤집는 일이 흔하기 때문입니다.

첫째는 작업당 토큰 수입니다. 요율이 같은 두 모델이라도 같은 답에 도달하기까지 쓰는 토큰 수가 크게 다를 수 있고, 말이 많은 저렴한 모델이 말수가 적은 비싼 모델보다 작업 하나를 끝내는 데 더 비쌀 수 있습니다. 둘째는 재시도 비율입니다. 다시 생성해야 하는 답변은 두 번 청구됩니다. 셋째는 토큰 요금 밖의 모든 것입니다. 호출 한도, 응답 속도, 컨텍스트 창 크기, 지역별 제공 여부, 내가 다루는 파일 형식을 모델이 읽을 수 있는지 등입니다.

이런 비교 글은 후보를 거르는 용도로 쓰는 것이 맞습니다. 예산을 확실히 벗어나는 항목을 지우고, 후보 두세 개를 실제 내 작업에 써 본 뒤, 100만 토큰의 가격이 아니라 작업 하나를 끝내는 데 든 비용을 보세요. 메시지별 예상 비용은 바로 이 실험을 청구 주기가 아니라 하루 만에 끝낼 수 있게 하려고 있는 기능입니다.

자주 묻는 질문

LLM API에 메시지 하나를 보내면 실제로 얼마가 드나요?
요금 항목은 하나가 아니라 네 가지입니다. 보내는 토큰, 모델이 생성하는 토큰, 캐시에서 읽는 토큰, 그리고 일부 제공업체에서는 캐시에 쓰는 토큰입니다. 중간 가격대 모델에 짧은 질문을 하면 보통 1센트에 한참 못 미치지만, 긴 대화 끝에 같은 질문을 하면 더 비쌉니다. 매번 대화 전체가 입력으로 다시 전송되기 때문입니다.
출력이 입력보다 비싼 이유는 무엇인가요?
토큰 생성은 순차적으로 이루어지고 연산 자원을 많이 쓰는데, 프롬프트를 읽는 일은 그렇지 않아서 제공업체가 더 높은 가격을 매깁니다. 2026년 7월 24일 기준 제공업체 15곳을 조사한 결과, 중앙값에 해당하는 모델은 출력에 입력의 4배를 받았고, 약 7곳 중 1곳은 6배 넘게 받았습니다. 프롬프트를 줄이는 것보다 짧은 답변을 요청하는 편이 대개 더 효과적입니다.
프롬프트 캐싱으로 정말 비용이 줄어드나요?
같은 긴 맥락을 여러 번 재사용한다면 줄어듭니다. 조사한 피드에서 약 5곳 중 1곳의 모델이 캐시 읽기 가격을 공개했고, 공개한 경우 해당 모델 입력 요율의 중앙값 10% 수준이었습니다. 일부 제공업체는 캐시 쓰기에도 요금을 매기므로, 한 번만 쓰는 맥락을 캐싱하면 캐싱하지 않을 때보다 조금 더 비쌀 수 있습니다.
종량제 API가 월정액 AI 구독보다 저렴한가요?
사용량이 적거나 들쭉날쭉하다면 대개 그렇고, 매일 꾸준히 많이 쓴다면 월정액이 유리한 경우가 많습니다. 모두에게 통하는 절약 비율은 없습니다. 역전 지점은 메시지 양, 답변 길이, 고르는 모델에 따라 달라지기 때문입니다. 일반론을 믿기보다 비용 계산기로 현재 가격 기준 평범한 한 주를 계산해 보세요.
같은 모델인데 플랫폼마다 가격이 다른 이유는 무엇인가요?
이유는 두 가지입니다. 오픈 웨이트 모델은 하드웨어와 마진이 다른 여러 추론 호스팅 업체가 제공하므로, 같은 가중치라도 실제로 요율이 다를 수 있습니다. 그리고 모델 이용권을 되파는 플랫폼은 차익, 충전 수수료, 일정 비율, 크레딧 제도 같은 자체 계층을 더합니다. 확인해야 할 것은 제공업체 공개 정가에서 내가 내는 금액까지의 계산 방식이 공개되어 있는지입니다.
이 글의 가격 정보는 얼마나 최신인가요?
모든 수치는 2026년 7월 24일 Oriveo의 프로덕션 메타데이터 피드(contract 버전 47, 2026-07-24T01:00:09Z 생성)에서 가져왔습니다. 제공업체 가격은 자주 바뀌므로 이 숫자들은 그날의 스냅숏으로 보면 됩니다. 사이트의 비용 계산기는 같은 피드를 실시간으로 읽으므로, 현재 요율은 계산기에서 확인하는 것이 정확합니다.
Oriveo는 제공업체 요금에 수수료를 붙이나요?
붙이지 않습니다. 본인 API 키를 쓰면 각 제공업체가 공개 정가로 본인 계정에 청구하고, Oriveo는 그 위에 아무것도 받지 않습니다. 호스팅 사용량은 선불 잔액에서 각 모델의 공식 정가로 차감됩니다. Oriveo 유료 요금제는 기기 간 동기화나 사용량 분석 같은 소프트웨어 기능에 대한 것이며, AI 사용료나 모델 크레딧은 포함되지 않습니다.

함께 읽기

메시지를 보낼 때마다 비용 확인하기

Oriveo는 iPhone, Android, 웹에서 공식 제공업체 15곳의 700+ 모델을 쓸 때 모든 메시지에 제공업체 정가 기준 예상 비용을 표시합니다. 제공업체 사용료에 수수료는 붙지 않습니다.