Ollama запускает открытые модели нейросетей на своём компьютере или сервере без облака и без ежемесячной платы за токены. Для бизнеса важнее другое — какую задачу решает локальный запуск и где он оправдан, а где выгоднее облачный api.
Модель на сервере
Ollama — программа, которая скачивает открытые веса модели и поднимает локальный api на компьютере или сервере: запросы остаются в контуре компании, а расходы упираются в железо вместо тарифа вендора за токен.
Принцип простой: команда вида «ollama run <модель>» скачивает выбранную модель при первом запуске и сразу открывает с ней диалог в терминале, а повторные обращения идут через локальный http-адрес, который подключается к любому скрипту, боту или сценарию n8n. Модель считается открытой, когда разработчик публикует веса — файл с обученными параметрами — и лицензию на использование; своих моделей у Ollama нет, она — только среда запуска для уже опубликованных весов.
- Данные остаются на своём оборудовании — запрос покидает контур компании, только если сама компания вынесет его наружу
- Стоимость ограничена железом и электричеством, а платы за каждый токен вендору нет
- Работа продолжается без доступа в интернет, если модель и данные уже на месте — полезно для пилота в изолированном контуре
- Выбор модели — под задачу и мощность оборудования, вместо ограничения одним поставщиком api
- Обновления модели скачиваются вручную — версия на сервере меняется только по решению команды, без автоматической подмены при выходе новой сборки
Какие модели запускают
Через Ollama компании чаще запускают модели из открытых семейств — Qwen, DeepSeek, Llama, Mistral. Каждое семейство объединяет линейку версий разного размера — от лёгкой, которая уместится на рабочем ноутбуке, до тяжёлой для отдельного сервера с мощной видеокартой, а название семейства — только точка входа для выбора.
Qwen и DeepSeek чаще выбирают под русский язык и точность формулировок в переписке, Llama — за экосистему инструментов и обилие готовых надстроек, Mistral — за компактность моделей, которые запускаются на скромном железе. Разница ощутимая только на своих текстах — сравнение стоит проводить на реальных документах и вопросах компании вместо абстрактных бенчмарков. Полезно сослаться и на разбор конкретных моделей — что попробовать в Ollama, показано в статьях про запуск Qwen на своём сервере и про локальный DeepSeek.
- Тексты на русском языке — переписка, договоры, обращения клиентов
- Код и техническая документация — код-ассистенты и разбор логов
- Общие рассуждения и объёмный контекст — сводки по большим документам
Размер модели внутри семейства — компромисс между качеством и требованиями к железу: лёгкая версия отвечает быстрее и уместится на обычном сервере, тяжёлая версия точнее на сложных формулировках, но просит мощную видеокарту. Правильный размер подбирается пробой на реальных задачах компании вместо абстрактного рейтинга из обзора.
Зачем бизнесу
Причина обычно одна из трёх. Первая — конфиденциальность: документы юриста, кадровая переписка и финансовая отчётность остаются на сервере компании, и у зарубежного сервиса доступа к ним нет. Вторая — пилот без бюджета на api: команда проверяет гипотезу на локальной модели бесплатно и переходит на платный сервис, только если сценарий действительно работает. Третья — автономная работа там, где интернет нестабилен или ограничен: склад, производство, филиал без выделенного канала.
- Юридический отдел проверяет черновик договора локальной моделью до отправки во внешний контур на финальную вычитку
- Служба поддержки тестирует ответы бота на локальной модели перед подключением платного api на весь поток обращений
- Производство держит справочник по оборудованию и регламентам на сервере без интернета, доступном прямо в цеху
Ставить локальную модель заменой облачному флагману без проверки качества на своих задачах — экономия на токене оборачивается потерей точности там, где цена ошибки высокая: юридический текст, финансовый расчёт, ответ клиенту.
Решение обычно принимает связка ИТ и владельца процесса — ИТ отвечает за сервер и обновления, владелец процесса — за качество ответов и обратную связь от сотрудников, которые используют модель каждый день.
Как подключить
- Установите Ollama на сервер или рабочую станцию и скачайте одну-две модели под задачу — русский текст, код или общий чат.
- Проверьте ответ на десятке реальных вопросов компании — договор, обращение клиента, внутренняя инструкция — и сравните с привычным сервисом.
- Подключите локальный http-адрес модели к сценарию — боту поддержки, обработчику заявок или цепочке в n8n; подробный разбор — в статье n8n локально для компании.
- Зафиксируйте регламент — какие данные разрешено отправлять в модель, кто отвечает за обновление весов и куда эскалировать, если ответ ошибся.
Модель, которая прошла проверку на тестовых вопросах, — только начальная точка: повторная проверка через месяц реальной эксплуатации ловит пограничные случаи, мимо которых прошёл пилот.
Дальше — оценка ресурса: сервер с видеокартой требует денег и администрирования, и это лучше закладывать в план заранее, до пилота, вместо разбора по факту.
Хотите проверить локальную модель на своих задачах?
Границы и проверка
| Что проверить | Как проверить | Кто отвечает |
|---|---|---|
| Качество ответа на русском | 20–30 реальных вопросов компании против привычного сервиса | Тот, кто ставит задачу модели |
| Скорость на своём железе | Замер на типичном документе вместо короткого демо-теста | ИТ или подрядчик, который настраивал сервер |
| Обновление весов | Регламент — когда и кто скачивает новую версию модели | Ответственный за контур ии в компании |
Одна машина с Ollama — рабочий инструмент для пилота или отдела. Полноценная нагрузка на весь коллектив требует отдельного сервера и распределения запросов между пользователями — масштаб полезно проверить на реальном числе одновременных обращений заранее, до старта проекта, вместо разбора после первых жалоб на скорость.
Дальше — вопрос архитектуры контура: какие данные остаются локально, какие уходят во внешний сервис, и как это сочетается с остальными системами компании. Разбор под вашу инфраструктуру — на ИИ-консалтинге; про формат весов, который Ollama использует под капотом, — в статье GGUF для локального запуска.
Отдельный пункт регламента — обновление модели. Новая версия семейства выходит время от времени, и переход на неё полезно проверить на том же наборе тестовых вопросов, прежде чем менять модель во всех подключённых сценариях сразу: качество ответа иногда меняется в неожиданную сторону, и обнаружить это лучше на тесте, чем на живом обращении клиента.