DeepSeek V4 в API представлена двумя моделями — deepseek-flash и deepseek-v4-pro, и разница в цене между ними ощутимо влияет на счёт компании за месяц. Модель выбирают под конкретную задачу и бюджет, вместо линейки целиком.
Две модели вместо одной
В линейке DeepSeek V4 через API доступны deepseek-flash — быстрая и дешёвая модель для массовых задач, и deepseek-v4-pro — точнее и дороже для сложных документов и агентов.
Нумерация версий в поиске гуляет — встречаются запросы про «deepseek 4.1» или «deepseek v4 flash», но ориентир для рабочего подключения один: официальные названия моделей из документации вендора, deepseek-flash и deepseek-v4-pro. Старые названия вроде deepseek-chat или deepseek-reasoner из документации вендора уже убраны — используйте актуальные имена при вызове API.
Контекстное окно у линейки — до 1 миллиона токенов, а максимальный объём вывода за один ответ — 384 тысячи токенов; это разбор большого документа или длинного диалога целиком, без нарезки на части вручную.
Для сравнения: разбор договора на полсотни страниц или расшифровки часовой встречи с большим запасом умещается в одном запросе, без предварительного дробления текста на куски и последующей склейки ответов вручную. Это упрощает архитектуру сценария — меньше шагов, меньше мест, где что-то может сломаться.
Когда хватает flash
- Классификация обращений по теме или срочности
- Извлечение данных из документа по шаблону: даты, суммы, реквизиты
- Массовые черновики: описания товаров, короткие ответы поддержки
- Первый фильтр перед тем, как передать сложный случай модели уровня pro
Flash-модель оправдана там, где задач много, а каждая по отдельности простая: тысяча однотипных обращений в день выгоднее прогонять через дешёвую модель, чем через дорогую. Ошибка на паре процентов запросов в таком потоке обходится дешевле, чем переплата за точность, которая тут ни к чему.
Условный пример: сервис поддержки сортирует входящие обращения по трём темам — оплата, доставка, качество товара — и сразу назначает нужный отдел. Ошибиться в паре случаев из сотни для сортировки некритично, оператор перенаправит письмо вручную за секунду; переплачивать за модель уровня pro ради такой задачи незачем.
Когда нужен pro
| Задача | Почему pro | Риск на flash |
|---|---|---|
| Разбор договора на риски | Держит нюансы формулировок в длинном тексте | Пропуск спорного пункта |
| Агент с несколькими шагами | Точнее планирует цепочку действий | Агент сбивается на середине сценария |
| Код для продакшена | Меньше ошибок в сложной логике | Баг, который дорого чинить постфактум |
Правило простое: чем выше цена ошибки в конкретной задаче, тем разумнее взять pro-уровень, даже если запросов немного. Для агента, который сам решает, что делать дальше без проверки человеком на каждом шаге, экономия на модели превращается в риск для всего сценария.
На практике внедрений разумная стратегия — смешанная: flash разбирает поток и отсеивает простое, а pro подключается точечно на сложных случаях, которые flash сам же помечает как спорные. Так за pro-уровень платят только там, где он реально нужен, вместо прогона всего потока через дорогую модель целиком.
Сколько запросов в день пройдёт через вашего будущего агента?
Как считать бюджет
Цены у DeepSeek считаются за миллион токенов отдельно на входе и на выходе, причём тариф ниже в непиковые часы по UTC — по прайсам на сентябрь 2026 разница между пиковым и непиковым окном для обеих моделей примерно вдвое. Точные цифры собраны в статье как получить API-ключ DeepSeek и сколько это стоит.
Возьмите N запросов в день × среднюю длину запроса и ответа в токенах × цену модели за миллион токенов из прайса вендора. Условный пример: 200 запросов в день по 500 токенов на входе и 500 на выходе дают около 200 тысяч токенов в сутки — дальше умножаете на актуальную ставку модели и на число рабочих дней.
Кэшированные токены — отдельная строка в прайсе, и разница с обычным входом там заметная: повторяющийся системный промпт или одна и та же инструкция в начале каждого запроса обходятся ощутимо дешевле при попадании в кэш. Для сценария с повторяющейся частью промпта эту графу разумно смотреть отдельно, вместо усреднения по общей ставке.
Бюджет на токены разумно пересчитывать раз в месяц-два по факту использования: реальный трафик обычно отличается от прогноза, а доля запросов, где хватает flash вместо pro, со временем меняется по мере того, как команда учится формулировать задачу точнее.
Доступ и свой сервер
Оплата API DeepSeek напрямую российскими картами недоступна — площадка зарубежная, и это разумно учитывать на этапе планирования бюджета заранее, до подключения ключа.
Разработчику или подрядчику, который настраивает интеграцию, обычно приходится решать вопрос оплаты и доступа как отдельную организационную задачу, параллельно с самой разработкой сценария. Закладывайте время на этот шаг в план проекта заранее, вместо переноса на последний день перед запуском.
DeepSeek публикует открытые веса части своих моделей — актуальный список лучше проверять на странице релиза вендора перед стартом. Если веса нужной версии доступны, открывается третий путь: локальный запуск DeepSeek на своём сервере, без обращения к внешнему API на каждый запрос. Обратная сторона — сервер под такую модель нужен мощный, а обновлять веса вручную приходится самостоятельно.
Локальный запуск редко выбирают ради экономии на токенах — аренда достаточно мощного сервера сама по себе обходится в заметную сумму. Выбирают его ради данных, которые нельзя выпускать за периметр компании: медицинские записи, финансовая отчётность, внутренние документы с грифом ограниченного доступа.
Ограничения версии — что модель делает хуже конкурентов и где спотыкается — собраны отдельно в статье ограничения DeepSeek для компании. Прямое сравнение с ближайшим конкурентом по популярности среди российских компаний — в материале Qwen или DeepSeek для компании.
Если выбор между flash, pro и локальным запуском под вашу задачу неочевиден заранее — тема для отдельного разбора: подход к оценке и подбору модели под конкретный процесс компании собран на странице ии-консалтинга.
Правильный выбор модели редко очевиден с первого взгляда — на бумаге задача может выглядеть простой, а на реальных данных компании всплывают нюансы, которые меняют расчёт. Короткий пилот на паре десятков реальных запросов обычно даёт больше ясности, чем долгое сравнение характеристик моделей по документации.