DeepSeek можно запустить локально на своём сервере через открытые веса модели и инструменты вроде Ollama или vLLM — данные тогда остаются внутри компании вместо внешнего провайдера. Дальше разберём, какие веса брать, что нужно из железа и когда в этом есть смысл, а когда проще остаться на облачном API.

Зачем свой сервер

TL;DR

Короткий ответ: локальный запуск DeepSeek держит данные внутри контура компании и снимает зависимость от доступности внешнего сервиса — цена вопроса в железе и обслуживании вместо подписки за токены.

Компании выбирают локальный контур по трём причинам. Первая — конфиденциальность: документы, переписка и внутренние данные остаются на своих серверах вместо площадки зарубежного вендора. Вторая — устойчивость: свой сервер работает независимо от перегрузок и блокировок на стороне облачного сервиса. Третья — предсказуемая нагрузка: если запросов много и они регулярные, свой контур со временем обходится ровнее, чем оплата каждого токена у стороннего API.

  • Данные остаются внутри периметра компании — актуально для персональных данных клиентов и коммерческой тайны.
  • Работа сохраняется при сбоях и блокировках на стороне облачного сервиса.
  • Полный контроль над версией модели — обновление происходит по вашему графику вместо расписания вендора.

На практике к локальному контуру чаще возвращаются компании из финансового, юридического и медицинского секторов, где регулятор жёстко ограничивает передачу данных за периметр организации — там на первом месте требования комплаенса, а удобство инструмента уже вторично.

Открытые веса модели

DeepSeek публикует открытые веса части своих моделей — их можно скачать и запустить на собственном оборудовании без обращения к облачному API вендора. Это отличает такой сценарий от подписки на API: там вы платите за токены и подключаетесь к серверам DeepSeek, здесь модель физически работает на вашей инфраструктуре.

Точные размеры весов и требования к памяти для конкретной версии стоит смотреть на официальной странице модели перед запуском — они меняются с каждым релизом, и называть цифры без проверки на дату публикации рискованно. Общий принцип простой: чем крупнее модель, тем выше качество ответов и тем больше видеопамяти она требует.

Использование открытых весов в бизнесе обычно разрешено условиями лицензии конкретного релиза — их стоит прочитать перед стартом проекта, особенно если планируется коммерческое применение модели внутри продукта компании. Отдельно проверьте, обновляет ли вендор веса регулярно: у моделей без активной поддержки со временем растёт разрыв в качестве с облачной версией.

с чего начать

Прежде чем качать веса, определите задачу и приемлемое качество ответа. Часто для внутреннего помощника хватает облегчённой версии модели — экономия на железе получается ощутимой без потери в пользе для типовых задач.

Инструменты запуска

Модель редко запускают вручную — для этого есть готовые инструменты, каждый под свою задачу.

ИнструментЧто делаетКому подходит
Ollamaразворачивает модель одной командой, даёт локальный API и консольбыстрый старт, тестовый контур, небольшая команда
LM Studioдесктопное приложение с графическим интерфейсом поверх открытых моделейнетехнический сотрудник, локальная работа на одном компьютере
vLLMпродакшен-сервер с высокой пропускной способностью и очередью запросовнагрузка от нескольких сотрудников или встраивание в сервис компании
● Discovery · 1 час · бесплатно

Прикидываете локальный контур под свои данные?

Прийти на Discovery →

Ollama и LM Studio подходят для пилота и проверки гипотезы: поставить, загрузить веса, задать вопрос — счёт идёт на часы. vLLM встраивают уже на продакшен, когда контур обслуживает реальных сотрудников или клиентов и важна стабильная скорость ответа под нагрузкой.

Развёртывание обычно проходит по одной и той же схеме: установка инструмента на сервер, загрузка выбранных весов, проверка ответа модели на тестовых вопросах и подключение к внутренним системам компании через локальный API. Для пилота этого хватает; для продакшена добавляются мониторинг нагрузки и план масштабирования на случай роста числа пользователей.

Что нужно из железа

Главный ресурс — видеопамять GPU: чем крупнее модель, тем больше её нужно, чтобы веса поместились целиком. Квантование (сжатие весов с потерей части точности) снижает требования к памяти ценой небольшой просадки качества — частый компромисс для локального запуска на скромном железе.

  • CPU-запуск возможен для лёгких версий модели, но заметно медленнее GPU — подходит для тестов и знакомства с моделью, для рабочей нагрузки маловат.
  • Квантованные версии весов идут навстречу серверам без топового GPU — за счёт компромисса в точности ответов.
  • Аренда GPU в облаке — промежуточный вариант между своим железом и облачным API: данные считаются на выделенной машине, а капитальных вложений в оборудование нет.

Отдельная статья расходов — охлаждение и электропитание сервера под постоянной нагрузкой: GPU потребляет заметно больше энергии под работающей моделью, чем в простое, и это стоит включать в расчёт эксплуатационных расходов вместе со стоимостью самого оборудования.

Бюджет здесь считается через стоимость железа или аренды GPU, электричество и время инженера на настройку и поддержку — тариф за токены в этой картине отсутствует. Сравнивать такие расходы с подпиской на облачный API стоит по каждой конкретной задаче отдельно, индивидуально для своей нагрузки.

Когда лучше API

У локального контура есть свои условия применимости. Если запросов мало, а команда небольшая, оплата токенов через облачный API часто выходит дешевле и проще в обслуживании, чем содержание сервера с GPU под редкую нагрузку. Плюс к этому облачная модель обновляется вендором автоматически, а локальную версию нужно обновлять и патчить своими силами.

  • Малый и нерегулярный объём запросов — облачный API выгоднее по деньгам и по времени инженера.
  • Нет своей команды для поддержки сервера — обслуживание локального контура ляжет на подрядчика.
  • Требуется постоянный доступ к самой свежей версии модели — вендор обновляет облако быстрее, чем выходят новые открытые веса.

Комбинированный сценарий тоже встречается: часть задач держат на облачном API ради скорости и удобства, а самые чувствительные к данным процессы переводят на локальный контур — так закрывают оба требования сразу без переплаты за редко используемое железо.

Подробный разбор, из чего складывается стоимость своего сервера под нейросеть, — в статье сколько стоит развернуть локальную нейросеть на сервере, а про сценарии с особыми требованиями к конфиденциальности — в материале локальный ИИ для конфиденциальных данных. Если сомневаетесь, какой вариант подойдёт под вашу задачу, разбор архитектуры удобнее делать на консультации по внедрению.

Частые вопросы

Какие модели DeepSeek доступны для локального запуска?
Часть моделей DeepSeek выходит с открытыми весами и доступна для скачивания — точный список и версии стоит сверять на официальной странице релиза перед запуском, они обновляются со временем.
Сколько видеопамяти нужно для локального запуска?
Зависит от размера конкретной версии модели и от того, используется ли квантование. Ориентир смотрите в карточке весов на странице релиза — цифры для каждой версии свои и меняются с обновлениями.
Работает ли локальный DeepSeek без подключения к интернету?
После загрузки весов сама модель отвечает офлайн. Интернет нужен только для скачивания обновлений и, если используете дополнительные внешние сервисы вокруг контура.
Чем Ollama отличается от vLLM?
Ollama — про быстрый локальный старт с минимумом настройки, для теста или небольшой команды. vLLM — продакшен-инструмент под нагрузку от многих пользователей одновременно, с очередью запросов и упором на скорость.
Стоит ли малому бизнесу разворачивать DeepSeek локально?
Чаще выгоднее облачный API — свой сервер оправдан при высокой регулярной нагрузке или жёстких требованиях к конфиденциальности данных. Для редких задач подписка на токены обходится проще и без обслуживания железа.