Если компании нужен доступ к модели, которая работает на собственном сервере, из CRM, бота или скрипта, — за это отвечает Ollama API: локальный HTTP-интерфейс, через который сервис отправляет запрос и получает ответ модели тем же путём, каким работают облачные API. Разница только в адресе: вместо сайта вендора запрос идёт на собственный сервер компании. Решение подключать Ollama API оправдано, когда данные обязаны оставаться внутри периметра компании, а сервис уже умеет работать с обычным HTTP-интерфейсом.
Что даёт локальный интерфейс
Ollama API — это HTTP-интерфейс на собственном сервере компании — запрос и ответ, а также потоковый ответ и список установленных моделей, без обращения к внешнему облаку.
После запуска Ollama на сервере компания получает адрес внутри своей сети, куда сервисы отправляют запросы по тому же принципу, что и к облачному API: текст запроса, параметры и ответ модели в структурированном виде. Порт по умолчанию из документации — 11434, а дальше маршрут настраивают под конкретный сервис. Запрос обычно содержит имя модели, сам текст и набор параметров вроде степени случайности ответа — структура похожа на облачные API, и разработчик, знакомый с одним из них, разбирается во втором за несколько минут.
- Обычный запрос — текст на входе, ответ модели на выходе
- Потоковый ответ — текст приходит по частям, пока модель генерирует
- Список моделей — какие версии установлены и доступны на сервере
- Переключение модели без изменения кода сервиса, который к ней обращается
Для команды, которая уже подключала облачный API — например, через статью про получение ключа Claude API, — структура запроса к Ollama узнаётся быстро: разница в адресе сервера и отсутствии внешней оплаты за токены.
Типовые сценарии подключения
CRM тянет черновик письма через Ollama API вместо готового шаблона — модель подставляет детали клиента и историю переписки в текст. Внутренний бот в Telegram отвечает сотрудникам по регламентам компании, а скрипт разметки тикетов присваивает тему и приоритет каждому обращению до того, как его увидит человек.
| Сервис | Что делает через API |
|---|---|
| CRM (amoCRM, Битрикс24) | черновик письма или комментарий по сделке |
| Внутренний Telegram-бот | ответ сотруднику по регламентам и базе знаний |
| Скрипт разметки тикетов | тема, приоритет и короткое резюме обращения |
| n8n или Make | узел сценария, который вызывает модель на нужном шаге |
Выбор конкретного сценария зависит от того, где рождается запрос: если модель нужна внутри уже существующего сервиса, интерфейс остаётся прежним и меняется только адрес обращения. Если сценарий собирают заново, Ollama API берут отправной точкой сразу. Связка с n8n разобрана отдельно в статье про локальную установку n8n для компании — оба сервиса чаще ставят рядом, на одном сервере или в соседних контейнерах.
Совместимость и клиенты
Ollama поддерживает формат запросов, близкий к распространённому среди облачных API стилю, — готовые библиотеки и инструменты для работы с моделями чаще подключаются к ней без глубокой переделки кода. Точный список поддерживаемых полей и версий смотрите в документации проекта — она обновляется чаще любой статьи.
На практике это упрощает миграцию: сервис, написанный под один облачный API, переключают на Ollama заменой адреса и ключа доступа, а логика вокруг запроса остаётся прежней. Обратная миграция — с локальной модели обратно на облако — работает по тому же принципу. Разработчику, который уже писал код под облачный API, привычные библиотеки для работы с моделями часто подходят и здесь, с минимальной правкой адреса и параметров подключения. Ручная сборка запроса через обычный HTTP-клиент тоже работает, своими средствами и без сторонних библиотек вообще.
Безопасность и доступ
Локальный сервер снимает риск утечки через внешний канал, а собственные риски добавляет: без отдельной настройки доступ к API открыт любому устройству внутри сети компании, а иногда и за её пределами, если порт торчит наружу по ошибке.
- Доступ только внутри локальной сети — порт закрыт от внешнего интернета
- Список сервисов, которым разрешено обращаться к API, зафиксирован явно
- Логирование запросов — кто, когда и с каким текстом обратился к модели
- Отдельный технический аккаунт для каждого сервиса вместо общего доступа
Частая недоработка на старте — открытый порт без ограничения по IP-адресам: локальная сеть компании физически защищена периметром офиса, а сервер в облаке — уже своей отдельной оградой, и доступ к нему проверяют заранее, до первого рабочего запроса. Команда, которая уже настраивала доступ к внутренним сервисам компании, узнает здесь привычный набор мер — разница лишь в том, что за портом раньше обычно стояла база данных или админка, а теперь — языковая модель.
Проверка ограничения по сети выглядит конкретно: запрос с устройства вне списка разрешённых обязан получать явный отказ, а зависание без ответа означает, что фильтр настроен ошибочно.
Планируете подключить локальную модель к своим сервисам?
Проверка под нагрузкой
Одна видеокарта обрабатывает обычно один запрос за раз — параллельные обращения от нескольких сервисов встают в очередь, и это стоит учесть заранее, до подключения к рабочему процессу с потоком заявок.
- Отправьте несколько запросов подряд из разных сервисов и замерьте время ответа
- Проверьте, что очередь сохраняет старые запросы при новом входящем, без потерь
- Оцените время ответа на длинных запросах отдельно от коротких
- Сравните нагрузку на одну видеокарту с ожидаемым потоком заявок компании
Типовая ошибка на этом этапе — тестировать API с одного устройства и одним запросом за раз: очередь при этом остаётся незаметной, а на проде пять сервисов бьют в один порт одновременно. Условный пример: компания подключила Ollama API к CRM и к внутреннему боту сразу — оба сервиса запрашивают модель в один и тот же час пиковой нагрузки, и очередь удлиняется заметно быстрее, чем показывал тест с одним источником запросов.
Цель теста — узнать границу заранее, до момента, когда несколько сотрудников одновременно отправят вопрос боту в обеденный перерыв. Очередь сама по себе — нормальный режим работы одной видеокарты под несколько источников запросов, а поломкой это становится только тогда, когда время ответа расползается за пределы терпимого. Готовый запуск модели на сервере — тема отдельной статьи про запуск Ollama для компании; здесь описан следующий шаг — подключение к своим сервисам. Термин из документации — Ollama — разобран отдельно в глоссарии, а настройку контура под задачи компании обсуждаем на автоматизации бизнес-процессов.