Если компания подключает DeepSeek через API, каждый запрос и ответ считаются в токенах — маленьких кусках текста, на которые модель режет и вход, и свой ответ, — и суммарный расход растёт вместе с длиной переписки, а число сообщений тут — только часть картины. Кириллица режется на токены мельче латиницы, поэтому русский текст обходится дороже по счёту токенов, чем такой же по смыслу английский. Расход держат под контролем ровно теми же приёмами, что использует опытная команда разработки: короткий системный промпт, обрезка истории и лимит на сотрудника или сервис.
Что считается токеном
Токен для DeepSeek — единица счёта текста, отдельная от привычного слова: модель режет и вход, и ответ на такие куски, а кириллица обычно даёт больше токенов на тот же смысл, чем латиница.
Слово и токен — разные единицы: короткое слово укладывается в один токен, длинное или редкое слово модель делит на несколько частей, а знаки препинания и пробелы тоже уходят в отдельные токены при подсчёте.
Русский текст режется на токены мельче английского из-за особенностей алфавита и частотности слов в обучающих данных модели — та же мысль на английском обходится компактнее по числу токенов, чем на русском, при одинаковом смысле.
Токенизатор режет текст по внутреннему словарю модели — правила орфографии тут почти ни при чём: приставка, корень и окончание одного слова иногда попадают в разные токены, и предсказать разбивку заранее без инструмента токенизации почти нереально.
Итоговое число токенов запроса остаётся внутренней метрикой модели и редко попадает на экран обычного чат-приложения — сотрудник встречает его косвенно, уже в счёте за период.
Из чего складывается
Расход компании за диалог складывается из трёх слагаемых сразу: вход — текст запроса и системный промпт, выход — ответ модели, и повторная отправка истории — каждое новое сообщение в диалоге тащит за собой весь предыдущий разговор, если приложение устроено так.
- Системный промпт — инструкция модели, которая уходит с каждым запросом заново, если приложение её вправду отправляет постоянно
- История диалога — прежние сообщения пользователя и модели, которые повторно уходят вместе с новым вопросом в большинстве чат-интерфейсов
- Вложения и файлы — текст из загруженного документа тоже режется на токены и добавляется к расходу входа
Повторная отправка истории — главный источник роста счёта в долгом диалоге: к десятому сообщению модель заново получает все девять предыдущих реплик вместе с новым вопросом, и расход растёт быстрее, чем кажется по числу сообщений на экране.
Запрос с приложенным файлом устроен так же, как обычный текстовый запрос, — меняется лишь объём входа: страница документа обычно даёт кусок текста заметно длиннее короткого вопроса сотрудника, и это тоже ложится в общий счёт токенов.
Кабинет вендора
Точная цифра расхода токенов видна в личном кабинете вендора — там же обычно показывают разбивку по дню и по модели, хотя конкретное название раздела и вид графика вендор меняет время от времени, поэтому ориентир — сам факт, что такой раздел существует, а точный путь к нему смотрят в текущем интерфейсе.
На своём сервере с открытыми весами счёт устроен иначе: токены там — время работы видеокарты и электричество, а вендорского счёта тут нет вовсе, потому что запросы обрабатывает железо компании самостоятельно.
Разница между чатом и API по деньгам разобрана в статье когда компании нужен платный DeepSeek, а когда хватит бесплатного, а лимиты запросов и качество на русском языке — тема статьи какие ограничения есть у DeepSeek для компании. Здесь разговор только про сам счётчик токенов и способы держать его под контролем — и самый тяжёлый пункт в этом счётчике обычно повторная отправка истории диалога при каждом запросе.
Сколько сообщений истории ваш бот пересылает модели заново каждый раз?
Как держать расход
Четыре приёма снижают расход без потери качества ответа, и все четыре берут разработчики любого крупного чат-приложения, включая команды за пределами работы с DeepSeek.
- Короткий системный промпт — инструкция модели держится в паре предложений вместо длинного текста с примерами на каждый запрос
- Обрезка истории — приложение оставляет в контексте последние несколько реплик диалога вместо всей переписки с самого начала
- Кэш повторяющихся частей — системный промпт и часто повторяющийся кусок запроса вендор иногда засчитывает по льготной цене при повторном обращении; условия кэширования смотрят в актуальной документации вендора
- Лимит на сотрудника или сервис — приложение считает расход по каждому источнику запросов отдельно и останавливает поток при превышении заранее согласованной границы
Сравнивать расход между моделями удобнее на своих задачах, чем по общим обещаниям вендора: одна и та же переписка на DeepSeek и на другой модели даёт разное число токенов уже на входе, и разницу видно на реальном промпте компании точнее, чем в рекламном сравнении моделей.
Порядок приёмов имеет значение — короткий системный промпт и обрезка истории снижают расход на каждом запросе сразу, а кэш и лимиты работают тоньше и раскрывают эффект дольше, на масштабе недели или месяца использования.
Свой сервер и счёт
На своём или арендованном сервере компания переносит вопрос токенов из бухгалтерии в инженерию: важна тут скорость ответа и загрузка видеокарты под рабочую нагрузку команды, а счёта за токены в привычном виде вендор здесь вообще выставить некому.
Доступ к DeepSeek устроен двумя путями. Первый путь — прямая оплата сервису вендора, где карта российского банка сегодня остаётся нерабочей, и обходных схем оплаты в этой связке нет. Второй — открытые веса на своём или арендованном сервере: контур ставит компания сама, и токены там считает нагрузка на железо, а вендорского счёта за токены в этой связке нет.
Сократите системный промпт до пары предложений, обрежьте историю до последних реплик и поставьте лимит на команду — сравнение расхода до и после честнее любой таблицы тарифов вендора.
Команда, которая переходит на свой сервер ради контроля расхода, обычно проходит через переходный период — часть задач ещё идёт через API вендора, часть уже переведена на собственный контур, и сравнение расхода в этот период честнее вести по конкретной задаче, чем по каналу доступа в целом.
Общий разбор ограничений DeepSeek и того, как их планируют заранее, — в статье какие ограничения есть у DeepSeek для компании. Встраивание модели в рабочий контур компании целиком, вместе с расчётом нагрузки на команду, обсуждают на этапе внедрения ИИ.