Preço de API de LLM

Custo de API de IA: como o preço de LLM funciona

Do que o preço de uma API de LLM é feito, o que empurra a fatura, e a faixa real de entrada e saída em 15 provedores, medida em 24 de julho de 2026.

Oriveo TeamPublicado em Atualizado em 16 min de leitura
  • APIs de LLM cobram em até quatro medidores separados, e a maior parte das comparações de preço olha só um deles.
  • Tokens de saída custam, na mediana, quatro vezes o que custam os tokens de entrada, e até doze vezes.
  • Os preços de entrada publicados em 15 provedores vão de $0.01 a $150 por milhão de tokens, em 24 de julho de 2026.
Oriveo no iPhone: a lista de conversas, com o custo estimado de cada uma à direita.

Como o preço de uma API de LLM realmente funciona

Quase toda comparação de custo de API de IA cita um número por modelo, e esse número quase sempre é o preço de entrada. É o menos útil dos quatro números que um provedor publica. Um modelo cobra em medidores separados: os tokens que você envia, os tokens que ele escreve de volta, os tokens lidos de um cache e, em alguns provedores, os tokens gravados nesse cache. Cada medidor tem a própria tarifa, e as tarifas não ficam perto umas das outras.

Um token é mais ou menos três quartos de uma palavra em inglês, então um milhão de tokens fica em algum lugar perto de 750.000 palavras. Os preços são cotados por milhão de tokens porque mensagens individuais são tão baratas que um preço por mensagem seria só zeros. Esse enquadramento esconde a rapidez com que os medidores se somam numa conversa real, em que cada turno reenvia tudo o que foi dito antes.

A tabela abaixo mostra os quatro medidores para um punhado de modelos, tirados do mesmo feed de metadados que alimenta o seletor de modelos e a calculadora de custo deste site. Repare em como a coluna de entrada diz pouco: aqui os preços de entrada vão de 0,30 a 2,50 dólares, mas os de saída vão de 1,20 a 15,00 dólares, e a saída é o medidor que mais se move.

  • Entrada — tudo o que você envia: a sua mensagem, a conversa até ali, qualquer prompt de sistema, qualquer texto anexado.
  • Saída — tudo o que o modelo escreve de volta, inclusive tokens de raciocínio nos modelos que os produzem.
  • Leitura de entrada em cache — contexto repetido que o provedor já viu, cobrado a uma tarifa bem mais baixa que a entrada nova.
  • Gravação no cache — o que alguns provedores cobram para colocar esse contexto no cache pela primeira vez.
Como o preço de uma API de LLM realmente funciona
ModeloEntrada (USD / 1M tokens)Saída (USD / 1M tokens)Leitura de entrada em cacheGravação no cache
Claude Haiku 4.51.005.000.101.25
Claude Sonnet 52.0010.000.202.50
GPT-5.6 Luna1.006.000.101.25
GPT-5.6 Terra2.5015.000.253.125
Kimi k2.50.603.000.100.60
Qwen3.7 Plus0.503.000.050.625
MiniMax-M2.50.301.200.030.375

Os tokens de saída são a metade cara

O padrão mais confiável no preço de LLM é que escrever custa mais do que ler. Para pôr um número nisso, e não uma impressão, pegamos cada modelo de texto no feed de metadados do Oriveo que publica um preço por token — nos 15 provedores — e comparamos a tarifa de saída de cada modelo com a própria tarifa de entrada, em 24 de julho de 2026.

O modelo mediano cobra exatamente quatro vezes mais pela saída do que pela entrada. Cerca de um modelo em cada dez cobra o mesmo pelos dois, ou menos pela saída, o que é típico de modelos de pesos abertos servidos por servidores de inferência. Na outra ponta, cerca de um em cada sete cobra mais de seis vezes, e a maior distância no feed é de doze vezes.

Isso muda direto a forma de gastar. Enxugar o prompt é a otimização que todo mundo tenta primeiro, e em geral é a alavanca menor. Pedir uma resposta mais curta, limitar o tamanho da saída ou escolher um modelo que não pense em voz alta por muito tempo move a fatura mais do que cortar um parágrafo da pergunta. Modelos de raciocínio merecem um segundo olhar aqui, porque os tokens de pensamento que eles geram são cobrados como saída mesmo quando você nunca os vê.

Os tokens de saída são a metade cara
Preço de saída comparado ao de entradaParcela dos modelos de texto com preço
Igual ou mais barato (1× ou menos)10%
1× a 2×11%
2× a 4×39%
4× a 6×25%
Mais de 6×15%

O que de fato empurra a sua fatura

As pessoas em geral se surpreendem com a primeira fatura de API por um de quatro motivos, e nenhum deles é o preço de manchete do modelo. A mecânica abaixo vale para todo provedor, porque decorre de como as APIs de chat funcionam, e não da política de um fornecedor.

O maior é o reenvio de contexto. Uma chamada de API não tem estado: o modelo não lembra o turno anterior, então o cliente precisa reenviar a conversa inteira a cada mensagem. Uma conversa que já passou de quarenta turnos envia quarenta turnos de histórico como entrada no turno quarenta e um. O custo de uma conversa, portanto, cresce mais ou menos com o quadrado do comprimento. Por isso uma conversa longa pode custar mais que vinte conversas curtas sobre o mesmo assunto.

O cache de prompt é o contrapeso, e vale entender antes de descartar. Provedores que o suportam deixam o contexto repetido ser cobrado como leitura em cache, em vez de entrada nova. No feed que medimos, cerca de um modelo em cada cinco publica um preço de leitura em cache, e, onde ele existe, a tarifa em cache fica numa mediana de 10% do próprio preço de entrada daquele modelo. O mais baixo que achamos fica abaixo de 1%, e o mais alto por volta de 58%. Alguns provedores também cobram para gravar o cache, em geral com um acréscimo sobre a entrada normal. O cache compensa quando o mesmo contexto é reutilizado várias vezes, e não quando é usado uma vez só.

  • Histórico da conversa — reenviado por inteiro a cada turno, então conversas longas custam bem mais do que a proporção sugere.
  • Prompts de sistema e presets — instruções reutilizáveis entram no começo de cada mensagem e multiplicam em silêncio a contagem de tokens.
  • Anexos — um documento ou uma imagem colocados num chat viram tokens de entrada e ficam no contexto em cada turno seguinte daquele fio.
  • Tokens de raciocínio — cobrados como saída nos modelos que os geram, esteja o raciocínio à mostra ou não.
  • Novas tentativas e regenerações — uma resposta regenerada é um segundo pedido cobrado por inteiro, não uma correção de graça.

O panorama de preço em 15 provedores

A tabela abaixo é um retrato da faixa de preço de entrada publicada em cada um dos 15 provedores a que o Oriveo se conecta. Ela conta só modelos de texto que publicam um preço por token, e mostra o mais barato e o mais caro deles naquele provedor. É um mapa de onde cada provedor se senta, não uma recomendação: o modelo mais barato de um provedor e o mais caro raramente se substituem.

Fonte e método, para você conferir: cada número vem do feed de metadados de produção do Oriveo, em api.oriveoai.com/api/metadata, contract version 47, gerado em 2026-07-24T01:00:09Z. É o mesmo feed que o app usa para precificar mensagens e o mesmo por trás da calculadora de custo deste site. Os preços estão em dólares americanos por milhão de tokens, em 24 de julho de 2026. Modelos de geração de imagem, e modelos que o provedor cobra por pedido e não por token, ficam de fora, porque um número por token não significaria nada para eles.

Duas coisas saltam. A primeira é a abertura: o preço de entrada mais barato do feed inteiro é $0.01 por milhão de tokens, e o mais caro é $150, um fator de quinze mil entre duas linhas do mesmo seletor, em 24 de julho de 2026. A segunda é que catálogo largo e preço baixo são eixos diferentes. Os agregadores carregam a faixa mais aberta porque revendem muitos fornecedores, enquanto um provedor de um só fornecedor se agrupa apertado em torno da própria escada de preços.

Trate cada número daqui como perecível. Provedores reajustam, lançam níveis mais baratos e aposentam modelos o tempo todo. Várias das linhas abaixo mudaram no último trimestre. Qualquer artigo que cita preço de modelo é uma fotografia. Por isso existem o feed ao vivo e a calculadora, e por isso esta página declara a data da captura em vez de insinuar que os números são permanentes.

O panorama de preço em 15 provedores
ProvedorModelos de texto com preço por token publicadoMenor entrada (USD / 1M)Maior entrada (USD / 1M)
OpenAI490.05150
Anthropic (Claude)101.0015
Google Gemini210.0752.00
xAI Grok61.002.00
DeepSeek40.140.435
Mistral320.042.00
Qwen490.0352.80
Kimi90.202.00
MiniMax70.300.60
Z.ai120.071.40
Groq70.030.59
Together AI690.023.50
Fireworks AI150.072.80
OpenRouter3050.01150
SiliconFlow490.041.74

Por que o mesmo modelo tem mais de um preço

Abra dois diretórios de modelos e você encontra o mesmo modelo com tarifas diferentes. Isso em geral não é um erro. Modelos de pesos abertos são servidos por vários servidores de inferência, cada um com o próprio hardware, a própria vazão e a própria margem, então um modelo pode legitimamente custar uma coisa num lugar e outra noutro. No feed acima, a mesma família de pesos abertos aparece em vários provedores, com tarifas de fato diferentes.

O segundo motivo é a camada pela qual você compra. Agregadores ficam entre você e o provedor de baixo e precisam pagar essa posição de algum jeito: uma margem no preço do token, uma taxa de recarga, um percentual sobre os pedidos, ou um sistema de créditos cuja conversão para tokens é definida pela plataforma, e não pela tabela do provedor. Nenhum desses caminhos é ruim por natureza. O que importa é o mecanismo estar publicado. O OpenRouter, por exemplo, documenta os termos às claras: em 24 de julho de 2026, a política publicada é uma taxa de 5.5% nas recargas de cartão, com mínimo de $0.80, e, para as chaves que você mesmo traz, o primeiro milhão de pedidos de cada mês sem cobrança, com 5% do preço normal do modelo descontado em créditos a partir daí.

Na hora de comparar plataformas, a pergunta que vale não é “quanto custa um crédito”, e sim “qual é o caminho publicado entre o preço de tabela do provedor e o que me cobram”. Se uma plataforma cobra em créditos e não publica essa conversão, a comparação que você faz não é com o preço do modelo. É com a política de preço da plataforma, e essa política pode mudar sem que o preço do modelo mude nada.

Assinatura ou pagamento por uso: o que fica mais barato para você

Esta é a pergunta com que a maioria de fato chega, e ela não tem resposta geral. Uma assinatura mensal fixa e o acesso medido por API se cruzam em algum volume de uso, e esse ponto depende das suas mensagens: o tamanho delas, o tamanho das respostas, qual modelo você escolhe e quanto duram as conversas. Quem cita uma porcentagem de economia sem os seus números está chutando.

Dá para fazer a conta em cerca de cinco minutos, e a aritmética não é difícil. Pegue uma semana típica de verdade, não a mais cheia. Conte as mensagens. Estime o tamanho médio das respostas em palavras e multiplique por cerca de 1.35 para chegar aos tokens. Some o lado da entrada, lembrando que cada turno reenvia a conversa até ali. Multiplique pelas tarifas publicadas de entrada e de saída do modelo e compare com a mensalidade que você está olhando. A calculadora de custo deste site faz isso contra os preços ao vivo, para você não ter de guardar as tarifas.

Alguns padrões de estrutura são estáveis o bastante para afirmar sem inventar números. O acesso medido tende a ganhar quando o uso é leve ou em picos, quando você usa vários modelos de vez em quando em vez de um com força, e quando boa parte do trabalho são perguntas curtas com respostas curtas. Assinaturas tendem a ganhar num volume diário alto e constante, e têm uma vantagem real que não é dinheiro: uma fatura previsível. Acesso medido sem ver o custo de cada mensagem é o pior dos dois mundos, e é exatamente a falha que uma estimativa de custo em cada mensagem existe para evitar.

Como reduzir de verdade o que você gasta

Quando dá para ver os medidores, a maior parte da economia vem de poucos hábitos, não de caçar o provedor mais barato. Na ordem aproximada de quanto mexem no número, para uma carga típica de chat:

O que em geral não funciona é passar tudo para o modelo mais barato do catálogo. Um modelo que precisa de três tentativas para acertar a resposta, a um quinto do preço, não é economia, e ainda leva o seu tempo. A versão útil do conselho é casar o modelo com a tarefa: modelos baratos para extração, formatação, resumo e tradução; os caros para o trabalho pelo qual você teria pagado uma pessoa.

  • Comece uma conversa nova para um tema novo. Esta é a maior alavanca, porque você para de pagar o reenvio de um histórico que não serve.
  • Peça respostas mais curtas quando quiser uma resposta mais curta. A saída é o medidor mais caro em cerca de nove modelos em cada dez.
  • Case o modelo com a tarefa, em vez de deixar o mais forte como padrão para tudo.
  • Mantenha prompts de sistema e presets reutilizáveis enxutos. Eles são cobrados em toda mensagem que os usa.
  • Use cache de prompt onde o provedor suporta, e quando você reutiliza o mesmo contexto longo várias vezes.
  • Tire os anexos da conversa quando terminar com eles, em vez de carregá-los em cada turno seguinte.
  • Olhe a estimativa de uma mensagem antes de repetir esse padrão cem vezes.

Como o Oriveo mostra o custo

Cada mensagem no Oriveo carrega um custo estimado, calculado a partir do preço por token publicado pelo provedor e dos tokens de fato reportados, no instante em que a resposta termina. Essa estimativa existe em todas as camadas, inclusive na sem login, porque um custo que só aparece num plano pago não ajuda a decidir se vale pagar por alguma coisa. O mesmo feed de metadados das tabelas acima é o que fornece esses preços. Por isso o app não precisa que você mantenha uma tabela.

É uma estimativa, e está rotulada como tal. Os provedores aplicam o próprio arredondamento, unidades mínimas cobráveis, tarifas por conta e, de vez em quando, um preço promocional. As contagens de tokens são reportadas pelo provedor depois do fato. A estimativa serve para orientar decisões ao longo do mês. A fatura do seu provedor é a palavra final, e, quando as duas discordam, a fatura é que está certa.

A análise mais funda fica nos planos pagos. O Usage Insights — gasto separado por provedor e por modelo, tendências mensais e alertas de orçamento — faz parte de Pro e Lifetime, que custam $9.99 por mês, $59.99 por ano ou $149.99 uma vez, em 24 de julho de 2026. Esses planos compram só recurso de software: não incluem uso de IA, nem créditos de modelo, nem assinatura de provedor. O preço do app e o preço dos seus tokens nunca se juntam num número que você não consegue abrir.

Uma tela de uso que separa o gasto com IA por provedor e por modelo
A estimativa por mensagem existe em todas as camadas. O detalhamento por provedor e por modelo faz parte dos planos pagos.

O que estes números não conseguem te dizer

Uma tabela de preço é um começo, não uma decisão. Três coisas que ela deixa de fora merecem ser ditas com clareza, porque com frequência invertem uma comparação que parecia fechada só no preço.

A primeira é tokens por tarefa. Dois modelos na mesma tarifa podem gastar quantidades bem diferentes de tokens até chegar à mesma resposta, e um modelo barato e verboso pode custar mais por trabalho terminado do que um caro e seco. A segunda é a taxa de nova tentativa: uma resposta que você precisa regenerar é cobrada duas vezes. A terceira é tudo o que fica fora do medidor de tokens: limites de ritmo, latência, janela de contexto, disponibilidade na sua região e se o modelo lê os formatos de arquivo com que você trabalha.

O jeito honesto de usar uma comparação como esta é tratá-la como filtro de lista curta. Tire as linhas que estão claramente fora do orçamento, teste dois ou três candidatos no seu trabalho real e olhe quanto custa uma tarefa terminada, não quanto custa um milhão de tokens. A estimativa por mensagem existe justamente para que essa experiência leve um dia, e não um ciclo de fatura.

Perguntas frequentes

Quanto custa, de verdade, uma mensagem para uma API de LLM?
Depende de quatro medidores, não de um: os tokens que você envia, os tokens que o modelo escreve de volta, tokens lidos do cache e, em alguns provedores, tokens gravados no cache. Uma pergunta curta a um modelo de preço médio em geral custa uma fração pequena de centavo, mas a mesma pergunta no fim de uma conversa longa custa mais, porque a conversa inteira volta como entrada a cada turno.
Por que a saída é mais cara que a entrada?
Gerar tokens é sequencial e preso a computação, de um jeito que ler o prompt não é, então os provedores cobram mais caro. Nos 15 provedores medidos em 24 de julho de 2026, o modelo mediano cobra quatro vezes mais pela saída do que pela entrada, e cerca de um em cada sete cobra mais de seis vezes. Pedir respostas mais curtas em geral mexe mais na conta do que encurtar o prompt.
O cache de prompt realmente reduz a fatura?
Pode reduzir, quando o mesmo contexto longo é reutilizado várias vezes. Cerca de um modelo em cada cinco no feed medido publica um preço de leitura em cache e, onde ele existe, fica numa mediana de 10% da própria tarifa de entrada daquele modelo. Alguns provedores também cobram para gravar o cache, então guardar um contexto que você usa uma vez só pode sair um pouco mais caro do que não guardar.
Uma API com pagamento por uso sai mais barata que uma assinatura mensal de IA?
Para uso leve ou irregular, em geral sim. Para uso diário pesado e constante, uma taxa fixa muitas vezes ganha. Não existe uma porcentagem universal, porque o cruzamento depende do volume de mensagens, do tamanho das respostas e do modelo escolhido. Estime uma semana típica numa calculadora de custo, contra os preços de agora, em vez de confiar numa frase geral.
Por que o mesmo modelo custa valores diferentes em plataformas diferentes?
Por dois motivos. Modelos de pesos abertos são servidos por vários servidores de inferência, com hardware e margens diferentes, então pesos idênticos podem de fato ter tarifas diferentes. E plataformas que revendem o acesso põem uma camada própria: uma margem, uma taxa de recarga, um percentual ou um sistema de créditos. A pergunta é se o caminho do preço de tabela do provedor até a sua cobrança está publicado.
Quão atuais são os preços deste artigo?
Cada número foi tirado do feed de metadados de produção do Oriveo em 24 de julho de 2026, contract version 47, gerado em 2026-07-24T01:00:09Z. Preço de provedor muda com frequência, então trate estes números como um retrato dessa data. A calculadora de custo do site lê o mesmo feed ao vivo, e é o lugar certo para conferir uma tarifa de agora.
O Oriveo acrescenta sobretaxa ao que os provedores cobram?
Não. Com as suas próprias chaves de API, cada provedor fatura a sua conta pelo preço de tabela publicado, e o Oriveo não fica com nada por cima. O uso gerenciado é cobrado pelo preço de tabela oficial de cada modelo, a partir de um saldo pré-pago. Os planos pagos do Oriveo cobrem recurso de software, como sincronização entre aparelhos e análise de uso. Eles não incluem uso de IA nem créditos de modelo.

Leituras relacionadas

Veja o custo de cada mensagem ao enviar

O Oriveo mostra um custo estimado em cada mensagem, pelo preço de tabela do provedor, em 15 provedores oficiais e 700+ modelos, no iPhone, no Android e na web, sem sobretaxa no uso do provedor.