КАК ВООБЩЕ СЧИТАЮТ ЦЕНУ LLM API
Все крупные провайдеры считают в токенах, а не символах или словах. Токен — кусок текста примерно в 3-4 символа для английского и заметно короче для русского и кода. Практический ориентир: русский текст токенизируется хуже английского, часто в 1.5-2 раза больше токенов на тот же смысл. Это первый источник недооценки бюджета у русскоязычных команд.
Тариф всегда состоит из двух ставок за миллион токенов (за 1M):
- Input — всё, что ты отправил: системный промпт, история диалога, RAG-контекст, определения инструментов.
- Output — то, что сгенерировала модель. Сюда же считаются токены «размышления» (reasoning/thinking), даже если ты их не видишь.
Ключевое правило, которое ломает интуицию новичков: output дороже input в 4-5 раз. Поэтому длинный промпт с коротким ответом дешёвле, чем короткий промпт с простынёй на выходе. Считать надо оба конца, а не только «размер запроса».
ПОЛНАЯ ТАБЛИЦА СТОИМОСТИ ТОКЕНОВ 2026
Ниже — ориентировочные ставки за 1M токенов по флагманским и рабочим моделям на середину 2026 года. Цифры по семейству Claude точны (взяты из актуального прайса Anthropic); по остальным провайдерам — порядок величины по замерам сообщества, конкретный тариф всегда проверяй на странице pricing провайдера, они двигаются часто. Свежие релизы моделей и инструментов отслеживаются в каталоге REDDYX.
| Модель | Класс | Input $/1M | Output $/1M | Контекст |
|---|---|---|---|---|
| Claude Opus 4.8 | флагман | $5.00 | $25.00 | 1M |
| Claude Sonnet 5 | рабочая | $3.00 | $15.00 | 1M |
| Claude Haiku 4.5 | дешёвая/быстрая | $1.00 | $5.00 | 200K |
| GPT-класс флагман | флагман | ~$2.5-5 | ~$10-20 | 128K-400K |
| GPT-класс mini | дешёвая | ~$0.15-0.6 | ~$0.6-2.4 | 128K+ |
| Gemini Pro-класс | рабочая | ~$1.25-2.5 | ~$5-10 | 1M-2M |
| Gemini Flash-класс | дешёвая/быстрая | ~$0.1-0.4 | ~$0.4-1.6 | 1M |
| Open-weight (self-host) | своя инфра | цена GPU/час | цена GPU/час | зависит |
Что видно из таблицы сразу:
- Разница между дешёвым и топовым тиром — около 50-100x. Выбор модели решает больше, чем любая микрооптимизация промпта.
- Внутри одного провайдера младшая модель обычно в 3-5 раз дешевле старшей на том же типе задач.
- Гигантский контекст (1M токенов) звучит красиво, но забить его целиком — это разово многие доллары только на input.
ПОЧЕМУ OUTPUT ДОРОЖЕ И ГДЕ ПРЯЧУТСЯ REASONING-ТОКЕНЫ
Генерация каждого токена ответа — отдельный прогон модели, поэтому output дороже: провайдер платит за вычисления построчно. Input же обрабатывается одним параллельным проходом (prefill) и стоит дешевле.
В 2026 отдельная ловушка — reasoning-токены. Модели с расширенным мышлением (adaptive thinking у Claude, o-серия у GPT, thinking-режимы у Gemini) генерируют невидимую цепочку рассуждений до финального ответа. Ты её часто не видишь в UI, но платишь за неё по ставке output. На сложной задаче «мышление» может съесть больше токенов, чем сам ответ. Если бюджет улетает в трубу — первым делом посмотри, не включён ли высокий effort/reasoning там, где хватило бы прямого ответа.
Как быстро оценить стоимость запроса
Не гадай по символам — считай токены через API токен-каунтера провайдера. Пример на Python для Claude (у OpenAI и Google свои аналоги):
from anthropic import Anthropic
client = Anthropic()
resp = client.messages.count_tokens(
model="claude-opus-4-8",
messages=[{"role": "user", "content": open("prompt.txt").read()}],
)
input_tokens = resp.input_tokens
price_in = 5.00 # $/1M input, Opus 4.8
price_out = 25.00 # $/1M output
expected_output = 800 # прикинь ожидаемую длину ответа
cost = (input_tokens / 1_000_000) * price_in \
+ (expected_output / 1_000_000) * price_out
print(f"input: {input_tokens} tok")
print(f"оценка стоимости запроса: ${cost:.5f}")
Важно: не используй tiktoken для не-OpenAI моделей — он занижает счёт на 15-20% на обычном тексте и сильнее на коде и русском. У каждого провайдера свой токенизатор.
ТРИ РЫЧАГА, КОТОРЫЕ РЕАЛЬНО РЕЖУТ СЧЁТ
1. Кэширование промпта — до -90% на input
Если у тебя большой стабильный префикс (системный промпт, документация, few-shot примеры), который повторяется от запроса к запросу, включай prompt caching. Первый запрос пишет кэш (наценка ~1.25x на записанную часть), последующие читают его по ставке ~0.1x от базового input. Экономия на повторяющемся контексте — до 90%.
Главное правило кэша: это префиксное совпадение. Любое изменение байта в начале промпта (дата, UUID, несортированный JSON) обнуляет кэш дальше по тексту. Держи волатильные данные в конце запроса, а не в системном промпте.
2. Батч-режим — -50% на всё
Если задача не требует ответа в реальном времени (разметка датасета, массовая суммаризация, оффлайн-обработка) — гони через Batch API. Скидка 50% на все токены. Большинство батчей завершается в пределах часа, потолок обычно 24 часа. Для фоновой обработки это самый дешёвый способ жить.
3. Правильный выбор модели под задачу
Классификация, извлечение полей, короткие ответы «да/нет» — это работа для дешёвого тира (Haiku, Flash, mini). Гонять флагман на «определи тональность отзыва» — сжигать деньги в 10-50 раз быстрее, чем нужно. Флагман бери туда, где корректность важнее цены: сложный код, длинные агентные цепочки, анализ.
- Дешёвая модель + хороший промпт часто бьёт дорогую модель на простой задаче.
- Кэш + батч на дешёвой модели — комбинированная экономия легко уходит за -80% против наивного использования флагмана.
SELF-HOST VS API: КОГДА СВОЯ ИНФРА ДЕШЕВЛЕ
Open-weight модели (Llama, Qwen, Mistral, DeepSeek и их производные) можно крутить у себя. Тогда «цена токена» превращается в цену GPU-часа. Грубый порог по замерам сообщества: пока объём меньше нескольких десятков миллионов токенов в сутки и нагрузка неравномерная — API почти всегда дешевле и проще (не платишь за простой GPU). Своя инфра начинает выигрывать на большом стабильном объёме, требованиях к приватности данных или когда нужен фиксированный latency без чужих рейт-лимитов.
Не забывай скрытую стоимость self-host: DevOps, обновления, мониторинг, простой железа. Sticker-цена «$0 за токен» обманчива.
ЧЕК-ЛИСТ РАСЧЁТА БЮДЖЕТА ПЕРЕД ЗАПУСКОМ
- Прогони реальные промпты через токен-каунтер — не угадывай по символам.
- Оцени среднюю длину ответа и умножь на output-ставку. Это обычно главная статья расхода.
- Проверь, включён ли reasoning/thinking — и нужен ли он на этой задаче.
- Вынеси стабильный контекст в кэшируемый префикс.
- Всё, что можно, переведи на дешёвый тир и/или батч.
- Посчитай стоимость на 1000 запросов, а не на один — так видно реальный масштаб.
Новые дешёвые модели и open-weight релизы появляются каждую неделю — удобно ловить их в каталоге REDDYX, где собраны свежие инструменты для AI/ML.
Частые вопросы
Почему output-токены дороже input?
Каждый токен ответа генерируется отдельным прогоном модели, тогда как весь input обрабатывается одним параллельным проходом. Поэтому output стоит в 4-5 раз дороже input у большинства провайдеров LLM API.
Сколько стоит 1 миллион токенов у Claude?
На середину 2026: Claude Opus 4.8 — $5 input / $25 output за 1M, Sonnet 5 — $3 / $15, Haiku 4.5 — $1 / $5. Кэш и батч-режим снижают эти суммы дополнительно.
Как реально снизить стоимость LLM API?
Три рычага: кэширование стабильного префикса промпта (до -90% на input), батч-обработка для не-realtime задач (-50% на всё) и выбор дешёвой модели под простые задачи вместо флагмана. Вместе дают экономию за -80%.
Считать токены через tiktoken можно?
Только для моделей OpenAI. Для Claude, Gemini и других tiktoken занижает счёт на 15-20% и сильнее на коде и русском тексте. У каждого провайдера свой токенизатор — используй его API count_tokens.
Прайсы двигаются, дешёвые модели выходят чаще, чем успеваешь их тестировать. Если не хочешь пропустить момент, когда очередной релиз обрушит твой счёт вдвое — залетай в Telegram-канал REDDYX AI — новые репозитории каждые 30-60 минут.