
Цена AI API выглядит простой только до первого счета. На странице модели указаны доллары за миллион токенов, но реальный расход зависит от соотношения input и output, длины истории, повторных запросов, кэша и доли задач, которые модель решила с первого раза. Поэтому вопрос «где токен дешевле?» почти всегда слишком узкий.
Разработчику нужен другой показатель: сколько стоит один полезный результат — закрытый тикет, проверенный pull request, обработанный документ или корректная JSON-запись. В этой статье разберем, как читать цены, сравним несколько показательных моделей и построим расчет, который можно применить к своему продукту.
Но прежде чем переходить к формулам, стоит посмотреть на рынок практично. Иногда деньги зарабатывает не тот, у кого первой появилась идея, а тот, кто раньше заметил информационный разрыв: где та же модель доступна дешевле, как оплачивается API и сколько лишних расходов создает неудачный маршрут. В AI-продуктах эта разница быстро превращается в маржу.
Поэтому давайте посмотрим на цены OdiRouter.ai — самого доступного и полного API-каталога моделей для российского рынка. На одной странице можно сравнить более 200 текстовых, графических, видео-, аудио- и 3D-моделей, увидеть отдельные цены input, output и cache, а затем выбрать маршрут под реальную задачу, а не под известность бренда.
Почему две цифры в прайсе еще ничего не говорят
У большинства текстовых моделей отдельно оплачиваются входные и выходные токены. Input — системный prompt, сообщение пользователя, история диалога, документы RAG и результаты инструментов. Output — ответ модели, включая reasoning-токены, если правила конкретной модели включают их в выход.
Output часто стоит заметно дороже input. Поэтому короткий запрос с чрезмерно длинным ответом может оказаться дороже большого документа, из которого модель извлекла пять полей. Для чат-бота особенно опасна растущая история: один и тот же контекст оплачивается снова на каждом ходе, если приложение не использует кэш или не сокращает диалог.
Небольшой срез цен: официальный API и odiRouter
Ниже — не полный каталог и не обещание вечной цены. Это проверенный срез на 25 июля 2026 года для стандартного синхронного API и короткого контекста. Все значения указаны в долларах за 1 миллион токенов. Цены меняются, поэтому перед расчетом production-бюджета их нужно повторно проверить.

На момент проверки у трех примеров разный уровень снижения цены, а у других моделей, мультимодальных входов, видео и аудио будет собственная схема тарификации.
OdiRouter.ai показывает цены по каждой модели и типу операции, а также рублевый ориентир. На момент проверки публичная страница использовала курс 78,0308 ₽ за $1 по данным ЦБ РФ. Рублевое значение является расчетным ориентиром и меняется вместе с курсом.
Если модель та же, становится ли ответ хуже из-за более низкой цены?
Цена доступа и качество модели — разные уровни системы. Если запрос отправляется в тот же model ID с одинаковыми параметрами, более низкая цена сама по себе не превращает модель в «облегченную копию». При этом два ответа не обязаны совпадать слово в слово: генерация вероятностная, а результат зависит от temperature, seed, системного prompt, контекста и версии модели.
Корректная проверка качества — не сравнить два красивых скриншота, а отправить одинаковый набор запросов, зафиксировать параметры и оценить фактический результат. Иллюстрация ниже показывает один такой пример на одинаковой модели.


Сценарий 1: чат поддержки — длинная история съедает бюджет
Представим, что один запрос в поддержку содержит 8 000 входных и 600 выходных токенов. Для тысячи таких обращений получится 8 миллионов input и 0,6 миллиона output. Даже без конкретного бренда видно: итог определяется двумя тарифами, а не одной рекламной цифрой.
Стоимость = 8 × цена input за 1M + 0,6 × цена output за 1M
Главная оптимизация здесь — не обязательно смена модели. Сначала удалите нерелевантную историю, храните структурированное состояние обращения, используйте summary и не просите модель повторять всю переписку. После этого сравнивайте несколько моделей в odiRouter на одинаковой выборке тикетов.
Сценарий 2: извлечение данных — маленькая модель может быть лучшей
Для извлечения номера договора, даты и суммы из документов часто важнее стабильный JSON, чем глубокое reasoning. Если компактная модель правильно обрабатывает 98% документов, флагман на всем потоке будет избыточным. Но если дешевая модель ломает схему и требует повторного вызова, экономия исчезает.
Поэтому считайте стоимость только после валидации. Один невалидный ответ — это не выполненная задача, даже если API-вызов был очень дешевым. Полезная схема: быстрая модель выполняет первую попытку, сервер проверяет JSON, а сложные случаи переходят на более сильную модель.
Сценарий 3: код и агенты — токены не являются единственной статьей расходов
Coding-агент может несколько раз читать файлы, вызывать инструменты, анализировать тесты и исправлять код. Самая дорогая часть здесь иногда не цена миллиона токенов, а лишний цикл агента. Модель, которая стоит дороже за один запрос, но завершает задачу за две итерации вместо шести, может снизить итоговую стоимость.
Для таких задач измеряйте pass rate тестов, количество tool calls, число итераций, полное время и стоимость успешного задания. Сравнение только input/output не показывает производительность агента.
Кэш: реальная экономия или новая строка расходов
Если приложение повторяет большой системный prompt, инструкции агента или один набор документов, cache read может стоить значительно дешевле обычного input. Но у некоторых API создание кэша оплачивается отдельно, а срок хранения ограничен. Кэш выгоден только тогда, когда записанный префикс действительно используется повторно.
До включения кэша посчитайте три числа: цену записи, цену чтения и ожидаемое количество повторных использований. Следите за cache hit rate. Кэш, который постоянно создается и почти не читается, увеличивает счет. odiRouter показывает отдельные строки Cache Read и Cache Write там, где они предусмотрены моделью.
Длинный контекст: невидимый ценовой порог
Некоторые модели используют повышенный тариф после определенного размера входного контекста. Например, у семейства GPT-5.6 в актуальной таблице есть отдельные уровни для запросов до 272K и выше 272K токенов. Это означает, что один чрезмерно большой запрос может перевести весь объем в более дорогой уровень.
Не путайте максимальное контекстное окно с рекомендацией всегда его заполнять. Для RAG сначала улучшайте retrieval и reranking. Десять релевантных фрагментов обычно полезнее сотен страниц, отправленных модели «на всякий случай».
Бесплатная модель — инструмент тестирования, а не бесконечный production
На публичной странице odiRouter есть бесплатные модели. Они подходят для знакомства с API, проверки формата и небольших экспериментов. Страница прямо указывает, что бесплатные варианты ограничены 100 запросами в день, а их список может меняться.
Это хороший способ проверить интеграцию и подготовить eval, но production-архитектуру следует считать по платному маршруту с понятными лимитами. Бесплатность не заменяет SLO, поддержку, мониторинг и резервную модель.
Как сравнить цены объективно за один вечер
Возьмите 100–300 обезличенных запросов из своего продукта.
Разделите их на типы: чат, извлечение, код, reasoning, изображения.
Зафиксируйте prompt, параметры и критерий успешного ответа.
Прогоните 3–5 моделей из odiRouter и сохраните usage.
Посчитайте retry, fallback, latency и процент корректных результатов.
Выберите модель по стоимости успеха, а не по цене одного токена.
Стоимость успешной задачи = стоимость всех вызовов, retry и fallback / количество результатов, прошедших проверку
Что проверить в прайсе перед запуском
Одинаковая ли версия и model ID сравниваются.
Цена указана за input, output, изображение, секунду видео или другую единицу.
Есть ли отдельная цена reasoning-токенов и кэша.
Меняется ли тариф после порога длинного контекста.
Включает ли выбранный режим batch-скидку или специальный processing tier.
Какой курс используется для рублевого ориентира.
Есть ли лимиты бесплатного и платного маршрута.
Почему цена odiRouter интересна российским командам
Для российского разработчика важна не только ставка за токен. Прямой зарубежный аккаунт может потребовать иностранную банковскую карту, отдельную валютную оплату и дополнительную операционную работу. odiRouter позволяет пополнять баланс в рублях, не требует иностранной карты и VPN и дает единый доступ к текстовым, графическим, видео-, аудио- и 3D-моделям.
Единый счет также упрощает model routing: команда может отправлять простые задачи в экономичный маршрут, сложные — в сильную модель, а при сбое использовать резерв другого семейства. Экономия возникает не только из разницы в прайсе, но и из правильного распределения трафика.
Вывод: лучший прайс — тот, который выдерживает ваш production-тест
Цена за миллион токенов полезна для shortlist, но решение о модели нужно принимать после измерения качества, задержки и числа попыток. Несколько точных цифр помогают увидеть масштаб разницы, однако окончательный бюджет определяется архитектурой продукта.
Проверьте актуальную цену в odiRouter, выберите несколько моделей одного класса и прогоните одинаковый eval. Если качество одинаковое, выигрывает более экономичный и стабильный маршрут. Если сильная модель заметно повышает success rate, оцените, окупает ли результат дополнительные токены. Такой подход объективнее любого лозунга «самый дешевый API».
Сравнить актуальные цены и модели на OdiRouter.ai
Методика проверки данных: цены odiRouter получены с публичной страницы /pricing и ее live-каталога 25 июля 2026 года; официальные цены сверены с публичными страницами соответствующих разработчиков в тот же день. Перед публикацией и после добавления изображения рекомендуется обновить дату и повторно проверить три строки сравнения.