Почему списалось больше токенов, чем в вопросе

Вопрос из пяти слов, а в истории расходов — тысячи токенов. Это не ошибка биллинга, и вот из чего они складываются.

2 мин · 9 сентября 2026 г. · токены · тарифы · биллинг

Частый вопрос: «я отправил одно предложение, почему в истории расходов две тысячи входных токенов». Ответ почти всегда в том, что отправили вы не одно предложение.

Что уходит в модель на самом деле

Модель не хранит состояние между вызовами. Всё, что она «помнит», приходит в каждом запросе заново. В счёт попадает:

Системный промпт. В IDE и агентах он большой и написан не вами. У инструментов вроде Claude Code это тысячи токенов инструкций, которые уходят с каждым запросом.

Вся история диалога. На десятом сообщении вы отправляете все предыдущие девять плюс ответы модели. Отсюда характерная картина роста: 1k, 3k, 7k, 12k токенов на одинаковых по длине репликах.

Определения инструментов. JSON-схемы функций уходят в каждом запросе целиком, даже если ни одна не будет вызвана.

Содержимое файлов. Одна команда «посмотри этот файл» добавляет весь файл во входные токены — и оставляет его там на все последующие шаги диалога.

Выходные токены тоже не только текст

Если модель умеет рассуждать, рассуждения оплачиваются как выход, даже когда вы их не видите. Ответ в три строки при включённом режиме размышлений легко стоит несколько тысяч выходных токенов.

Прерванная генерация тоже оплачивается: если вы нажали отмену на середине, сгенерированное до этого момента уже посчитано.

Где посмотреть правду

Не гадайте — API возвращает точные числа в поле usage каждого ответа:

bash
"usage": {"prompt_tokens": 6499, "completion_tokens": 214, "total_tokens": 6713}

Сравните это со своим представлением о запросе. Если prompt_tokens в разы больше, чем вы ожидали, — ищите историю, системный промпт или файлы в контексте.

В кабинете эти же числа лежат в истории расходов по каждому запросу.

Как сократить счёт

Порядок по отдаче: чистить историю, не держать в контексте прочитанные файлы, сокращать число подключённых инструментов, снижать глубину рассуждений там, где задача простая.

Важная особенность агентных нагрузок: в них до 99% токенов приходится на вход, а не на выход. Оптимизировать длину ответов бессмысленно — экономия там, где растёт контекст.

Когда стоит написать в поддержку

Если usage в ответе API и число в истории расходов расходятся — это уже вопрос к нам, присылайте идентификатор запроса. Но в подавляющем большинстве случаев числа сходятся, а расходится представление о том, что именно было отправлено.

zukko

Платите в 25×
меньше

за Claude Code & ChatGPT

Один ключ fetch_* и base URL api.zukko.pro — в Cursor, Claude Code, Codex и любом SDK.

Почему API списывает больше токенов, чем ожидалось · Zukko