Цены на LLM API

Сравнение цен на AI API: как на самом деле устроены цены LLM

Из чего складывается цена LLM API, что влияет на ваш счёт и какой на самом деле разброс цен на вход и выход у 15 провайдеров — по замерам на 24 июля 2026 года.

Oriveo TeamОпубликовано Обновлено 14 мин чтения
  • Счёт за LLM API идёт сразу по нескольким счётчикам, до четырёх, а большинство сравнений цен смотрят только на один.
  • Токены на выходе стоят в среднем (медиана) в четыре раза дороже токенов на входе, а бывает и до двенадцати раз.
  • Опубликованные цены на вход у 15 провайдеров на 24 июля 2026 года — от $0,01 до $150 за миллион токенов.
Oriveo на iPhone: список чатов, справа от каждого — примерная стоимость.

Как на самом деле устроены цены LLM API

Почти в любом сравнении цен на AI API для модели приводят одно число, и почти всегда это цена входа. Из четырёх чисел, которые публикует провайдер, оно самое малополезное. Модель считает деньги по отдельным счётчикам: токены, которые вы отправили, токены, которые она написала в ответ, токены, прочитанные из кэша, а у некоторых провайдеров ещё и токены, записанные в этот кэш. У каждого счётчика своя цена, и цены сильно различаются.

Токен — это примерно три четверти английского слова, так что миллион токенов — это где-то 750 000 слов. Цены указывают за миллион токенов, потому что отдельные сообщения стоят так мало, что цена «за сообщение» состояла бы из одних нулей. Из-за такой подачи не видно, как быстро счётчики складываются в настоящем разговоре, где каждый ход заново отправляет всё, что было сказано раньше.

В таблице ниже — все четыре счётчика для нескольких моделей. Данные взяты из той же ленты метаданных, на которой работают список моделей и калькулятор стоимости на этом сайте. Обратите внимание, как мало говорит столбец входа: здесь цены входа лежат в пределах от 0,30 до 2,50 доллара, а цены выхода — от 1,20 до 15,00 доллара, и сильнее всего влияет именно выход.

  • Вход — всё, что вы отправляете: ваше сообщение, предыдущий диалог, системный промпт, прикреплённый текст.
  • Выход — всё, что модель пишет в ответ, включая токены рассуждений у тех моделей, которые их создают.
  • Чтение из кэша — повторяющийся контекст, который провайдер уже видел; считается по гораздо более низкой цене, чем новый вход.
  • Запись в кэш — плата, которую некоторые провайдеры берут за то, чтобы вообще положить этот контекст в кэш.
Как на самом деле устроены цены LLM API
МодельВход (USD за 1 млн токенов)Выход (USD за 1 млн токенов)Чтение из кэшаЗапись в кэш
Claude Haiku 4.51,005,000,101,25
Claude Sonnet 52,0010,000,202,50
GPT-5.6 Luna1,006,000,101,25
GPT-5.6 Terra2,5015,000,253,125
Kimi k2.50,603,000,100,60
Qwen3.7 Plus0,503,000,050,625
MiniMax-M2.50,301,200,030,375

Выход — дорогая половина

Самая надёжная закономерность в ценах LLM: писать дороже, чем читать. Чтобы говорить числами, а не впечатлениями, мы взяли все текстовые модели из ленты метаданных Oriveo, у которых опубликована цена за токен, у всех 15 провайдеров, и сравнили цену выхода каждой модели с её же ценой входа на 24 июля 2026 года.

Медианная модель берёт за выход ровно в четыре раза больше, чем за вход. Примерно у каждой десятой модели цена выхода такая же или ниже, что типично для моделей с открытыми весами, которые предлагают хосты вывода. На другом краю примерно у каждой седьмой цена выше чем в шесть раз, а самый широкий разрыв в ленте — двенадцатикратный.

Это прямо влияет на то, как тратить. Сократить промпт — оптимизация, за которую хватаются первой, и обычно она даёт меньше всего. Попросить более короткий ответ, ограничить длину вывода или выбрать модель, которая не рассуждает вслух подолгу, изменит счёт сильнее, чем вычёркивание абзаца из вопроса. Особенно стоит присмотреться к моделям с рассуждением: токены «размышления» оплачиваются как выход, даже если вы их никогда не видите.

Выход — дорогая половина
Цена выхода в сравнении с ценой входаДоля моделей с ценой
Такая же или ниже (не больше 1×)10%
От 1× до 2×11%
От 2× до 4×39%
От 4× до 6×25%
Больше 6×15%

Что на самом деле влияет на ваш счёт

Первый счёт за API обычно удивляет по одной из четырёх причин, и ни одна из них — не «витринная» цена модели. Механика ниже одинакова у всех провайдеров, потому что вытекает из того, как устроены чат-API, а не из политики какого-то из них.

Главная причина — повторная отправка контекста. Вызов API не хранит состояния: у модели нет памяти о предыдущем ходе, поэтому клиенту приходится с каждым сообщением заново отправлять весь разговор. Если переписка идёт сорок ходов, то на сорок первом ходу как вход уходят сорок ходов истории. Поэтому цена разговора растёт примерно как квадрат его длины, и один длинный разговор может стоить дороже двадцати коротких на ту же тему.

Противовес — кэширование запросов, и в нём стоит разобраться, прежде чем отмахиваться. Провайдеры, которые его поддерживают, считают повторяющийся контекст как чтение из кэша, а не как новый вход. В измеренной ленте примерно у каждой пятой модели опубликована цена чтения из кэша, и там, где она есть, кэшированная цена в медиане составляет 10% от цены входа самой модели: самая низкая — меньше 1%, самая высокая — около 58%. Некоторые провайдеры берут ещё и плату за запись в кэш, обычно с надбавкой к обычному входу, так что кэш окупается, когда один и тот же контекст используют несколько раз, а не один.

  • История разговора — отправляется целиком на каждом ходу, поэтому длинные переписки стоят непропорционально дороже.
  • Системные промпты и пресеты — готовые инструкции добавляются перед каждым сообщением и незаметно умножают число токенов.
  • Вложения — документ или изображение, брошенные в чат, становятся входными токенами и остаются в контексте на каждом следующем ходу этой переписки.
  • Токены рассуждений — оплачиваются как выход у моделей, которые их создают, показывают их вам или нет.
  • Повторы и перегенерации — перегенерированный ответ — это второй полноценный платный запрос, а не бесплатная поправка.

Цены у 15 провайдеров: общая картина

В таблице ниже — снимок опубликованного диапазона цен на вход у каждого из 15 провайдеров, к которым подключается Oriveo. Учитываются только текстовые модели с опубликованной ценой за токен, и показаны самая дешёвая и самая дорогая из них у этого провайдера. Это карта того, где стоит каждый провайдер, а не рекомендация: самая дешёвая модель провайдера и самая дорогая редко заменяют друг друга.

Источник и метод, чтобы вы могли проверить: каждое число взято из боевой ленты метаданных Oriveo на api.oriveoai.com/api/metadata, версия контракта 47, сформирована 2026-07-24T01:00:09Z — той же ленты, по которой приложение считает стоимость сообщений и которая стоит за калькулятором стоимости на этом сайте. Цены в долларах США за миллион токенов на 24 июля 2026 года. Модели для генерации изображений и модели, которые провайдер оценивает за запрос, а не за токен, исключены: для них цена за токен ничего бы не значила.

Заметны две вещи. Первая — разброс: самая низкая цена входа во всей ленте — $0,01 за миллион токенов, самая высокая — $150, то есть в пятнадцать тысяч раз больше между двумя строками одного списка выбора на 24 июля 2026 года. Вторая — что широта каталога и дешевизна — разные оси: у агрегаторов диапазон самый широкий, потому что они перепродают многих разработчиков, а у провайдеров одного разработчика цены сгруппированы плотно, вокруг их собственной линейки.

Относитесь ко всем числам как к скоропортящимся. Провайдеры пересматривают цены, выпускают более дешёвые линейки и снимают модели с поддержки постоянно; несколько строк ниже изменились за последний квартал. Любая статья с ценами на модели — фотография, поэтому и существуют живая лента и калькулятор, а на этой странице указана дата съёмки, а не подразумевается, что числа вечны.

Цены у 15 провайдеров: общая картина
ПровайдерТекстовые модели с опубликованной ценой за токенСамый низкий вход (USD за 1 млн)Самый высокий вход (USD за 1 млн)
OpenAI490,05150
Anthropic (Claude)101,0015
Google Gemini210,0752,00
xAI Grok61,002,00
DeepSeek40,140,435
Mistral320,042,00
Qwen490,0352,80
Kimi90,202,00
MiniMax70,300,60
Z.ai120,071,40
Groq70,030,59
Together AI690,023,50
Fireworks AI150,072,80
OpenRouter3050,01150
SiliconFlow490,041,74

Почему у одной модели бывает несколько цен

Откройте два каталога моделей, и одна и та же модель окажется там по разным ценам. Обычно это не ошибка. Модели с открытыми весами предлагают несколько хостов вывода, у каждого своё оборудование, пропускная способность и маржа, поэтому у одной модели на одном хосте может быть одна цена, а на другом другая. В ленте выше одно и то же семейство моделей с открытыми весами встречается у нескольких провайдеров по действительно разным ценам.

Вторая причина — слой, через который вы покупаете. Агрегаторы стоят между вами и провайдером модели и должны как-то окупать это положение: разницей в ценах на токены, комиссией за пополнение, процентом с запросов или системой кредитов, где обмен на токены определяет платформа, а не прайс-лист провайдера. Ничто из этого само по себе не плохо; важно, опубликован ли механизм. OpenRouter, например, открыто описывает свои условия: на 24 июля 2026 года по опубликованной политике комиссия при пополнении картой — 5,5% с минимумом $0,80, а для ключей, которые вы приносите сами, первый миллион запросов в месяц бесплатен, а дальше 5% от обычной цены модели списывается кредитами.

Когда вы сравниваете платформы, стоит спрашивать не «сколько стоит кредит», а «каким опубликованным путём прайс-лист провайдера превращается в то, что с меня списывают». Если платформа считает в кредитах и не публикует этот обмен, вы сравниваете не с ценой модели, а с ценовой политикой платформы, а она может меняться, даже когда цена модели остаётся прежней.

Подписка или оплата за использование: что дешевле именно вам

С этим вопросом чаще всего и приходят, и общего ответа у него нет. Фиксированная месячная подписка и оплата за использование через API пересекаются при каком-то объёме, а где именно, зависит от ваших сообщений: какой они длины, какой длины ответы, какую модель вы выбираете и сколько тянутся переписки. Кто называет процент экономии, не зная ваших цифр, тот гадает.

Посчитать можно минут за пять, и арифметика несложная. Возьмите по-настоящему обычную неделю, а не самую загруженную. Посчитайте сообщения. Прикиньте среднюю длину ответов в словах и умножьте примерно на 1,35, чтобы получить токены. Добавьте вход, помня, что каждый ход заново отправляет предыдущую переписку. Умножьте на опубликованные цены модели на вход и выход и сравните с месячным платежом, который вы рассматриваете. Калькулятор стоимости на этом сайте делает это по актуальным ценам, так что держать цены в голове не нужно.

Несколько закономерностей устойчивы настолько, что о них можно сказать без выдуманных цифр. Оплата за использование обычно выигрывает, когда пользуетесь понемногу или рывками, когда вы иногда берёте разные модели, а не одну постоянно, и когда большая часть работы — короткие вопросы с короткими ответами. Подписки обычно выигрывают при стабильно большом ежедневном объёме, и у них есть настоящее нефинансовое преимущество: предсказуемый счёт. Оплата за использование без видимой цены каждого сообщения — худшее из двух миров, и именно от этого защищает оценка стоимости у каждого сообщения.

Как на самом деле тратить меньше

Когда счётчики видны, большая часть экономии складывается из небольшого числа привычек, а не из поисков самого дешёвого провайдера. Вот они в порядке убывания влияния на цифру для обычной нагрузки в чате:

Обычно не работает переключение всего на самую дешёвую модель каталога. Модель, которой втрое дешевле, но нужно три попытки, чтобы получить правильный ответ, — это не экономия, а ещё и потерянное время. Полезная версия этого совета: подбирать модель под задачу, то есть дешёвые для извлечения данных, оформления, пересказа и перевода, а дорогие для работы, за которую вы раньше платили бы человеку.

  • Начинайте новый разговор для новой темы. Это самый мощный рычаг: вы перестаёте платить за повторную отправку ненужной истории.
  • Просите более короткий ответ, когда нужен короткий ответ. Примерно у девяти моделей из десяти выход — более дорогой счётчик.
  • Подбирайте модель под задачу, а не берите по умолчанию самую сильную для всего.
  • Держите системные промпты и готовые пресеты короткими: они оплачиваются в каждом сообщении, где используются.
  • Пользуйтесь кэшированием запросов там, где провайдер его поддерживает и вы снова и снова используете один и тот же длинный контекст.
  • Убирайте вложения из переписки, когда с ними покончено, а не таскайте их через все последующие ходы.
  • Посмотрите оценку сообщения, прежде чем повторять такой приём сто раз.

Как Oriveo показывает стоимость

У каждого сообщения в Oriveo сразу после окончания ответа есть примерная стоимость: её считают по опубликованным ценам провайдера на токены и по фактически сообщённым токенам. Такая оценка есть на любом уровне, в том числе без входа, потому что цена, которую видно только на платном тарифе, не помогает решить, платить ли вообще. Цены приходят из той же ленты метаданных, что и в таблицах выше, поэтому вам не нужно вести собственный прайс-лист.

Это оценка, и она так и подписана. У провайдеров есть своё округление, минимальные оплачиваемые единицы, ставки для отдельных аккаунтов и порой рекламные цены, а число токенов провайдер сообщает уже постфактум. Оценка нужна, чтобы направлять решения в течение месяца; последнее слово за счётом провайдера, и если цифры расходятся, прав счёт.

Более глубокий анализ есть в платных тарифах. Usage Insights — расходы с разбивкой по провайдерам и моделям, динамика по месяцам и оповещения о бюджете — входит в Pro и Lifetime, которые на 24 июля 2026 года стоят $9,99 в месяц, $59,99 в год или $149,99 разово. Эти тарифы покупают только возможности приложения: в них нет ни использования ИИ, ни кредитов на модели, ни подписки у провайдера, поэтому цена приложения и цена ваших токенов никогда не сливаются в одну цифру, которую нельзя разобрать.

Экран аналитики использования: расходы на ИИ по провайдерам и моделям
Оценка стоимости каждого сообщения есть на любом уровне; разбивка по провайдерам и моделям входит в платные тарифы.

О чём эти цифры не расскажут

Таблица цен — отправная точка, а не решение. Три вещи в ней не отражены, о них стоит сказать прямо, потому что они нередко переворачивают сравнение, которое по одной цене казалось решённым.

Первая — токены на задачу. Две модели по одной цене могут заметно различаться тем, сколько токенов тратят, чтобы прийти к тому же ответу, и многословная дешёвая модель может обойтись дороже за готовую работу, чем лаконичная дорогая. Вторая — доля повторов: ответ, который приходится перегенерировать, оплачивается дважды. Третья — всё, что находится вне счётчика токенов: лимиты запросов, задержка, окно контекста, доступность в вашем регионе и то, умеет ли модель читать форматы файлов, с которыми вы работаете.

Честный способ пользоваться таким сравнением — фильтр короткого списка. Отсейте строки, которые явно не по бюджету, попробуйте двух-трёх кандидатов на своей настоящей работе и смотрите, сколько стоит законченная задача, а не миллион токенов. Оценка стоимости сообщения существует именно для того, чтобы этот опыт занял день, а не расчётный период.

Вопросы и ответы

Сколько на самом деле стоит одно сообщение в LLM API?
Всё зависит от четырёх счётчиков, а не от одного: токены, которые вы отправили, токены, которые модель написала, токены, прочитанные из кэша, а у некоторых провайдеров ещё и токены, записанные в кэш. Короткий вопрос к модели средней цены обычно стоит малую долю цента, но тот же вопрос в конце длинной переписки стоит дороже, потому что весь разговор отправляется заново как вход на каждом ходу.
Почему выход дороже входа?
Генерация токенов идёт последовательно и упирается в вычисления так, как чтение промпта не упирается, поэтому провайдеры оценивают её выше. У 15 провайдеров, измеренных на 24 июля 2026 года, медианная модель берёт за выход в четыре раза больше, чем за вход, а примерно у каждой седьмой — больше чем в шесть раз. Попросить более короткие ответы обычно даёт больше, чем сократить промпт.
Правда ли, что кэширование запросов снижает счёт?
Может, если один и тот же длинный контекст используется несколько раз. Примерно у каждой пятой модели в измеренной ленте опубликована цена чтения из кэша, и там, где она есть, она составляет в медиане 10% от цены входа самой модели. Некоторые провайдеры берут ещё и плату за запись в кэш, поэтому кэширование контекста, который вы используете один раз, может обойтись чуть дороже, чем вообще без кэша.
API с оплатой за использование дешевле ежемесячной подписки на ИИ?
При небольшом или неровном использовании обычно да, а при стабильно большой ежедневной работе часто выигрывает фиксированный платёж. Общего процента нет, потому что точка пересечения зависит от объёма ваших сообщений, длины ответов и выбранной модели. Прикиньте обычную неделю в калькуляторе стоимости по актуальным ценам, а не доверяйте общим утверждениям.
Почему одна и та же модель стоит по-разному на разных платформах?
По двум причинам. Модели с открытыми весами предлагают несколько хостов вывода с разным оборудованием и маржой, поэтому одинаковые веса могут действительно стоить по-разному. А платформы, которые перепродают доступ, добавляют свой слой: разницу в цене, комиссию за пополнение, процент или систему кредитов. Нужно спрашивать, опубликован ли путь от прайс-листа провайдера до вашего списания.
Насколько актуальны цены в этой статье?
Все цифры взяты из боевой ленты метаданных Oriveo 24 июля 2026 года, версия контракта 47, сформирована 2026-07-24T01:00:09Z. Цены провайдеров меняются часто, поэтому считайте эти числа снимком на ту дату. Калькулятор стоимости на сайте читает ту же ленту в реальном времени, и проверять актуальную цену стоит там.
Добавляет ли Oriveo наценку к тому, что берут провайдеры?
Нет. Со своими API-ключами каждый провайдер выставляет счёт на ваш аккаунт по опубликованному прайс-листу, а Oriveo сверху ничего не берёт. Готовое использование списывается по официальному прайс-листу каждой модели с предоплаченного баланса. Платные тарифы Oriveo оплачивают возможности приложения, такие как синхронизация между устройствами и аналитика расходов, в них нет ни использования ИИ, ни кредитов на модели.

Читайте также

Смотрите, сколько стоит каждое сообщение, пока отправляете его

Oriveo показывает примерную стоимость у каждого сообщения по прайс-листу провайдера: 15 официальных провайдеров и 700+ моделей на iPhone, Android и в вебе, без наценки на использование провайдеров.