Если компании нужен доступ к модели, которая работает на собственном сервере, из CRM, бота или скрипта, — за это отвечает Ollama API: локальный HTTP-интерфейс, через который сервис отправляет запрос и получает ответ модели тем же путём, каким работают облачные API. Разница только в адресе: вместо сайта вендора запрос идёт на собственный сервер компании. Решение подключать Ollama API оправдано, когда данные обязаны оставаться внутри периметра компании, а сервис уже умеет работать с обычным HTTP-интерфейсом.

Что даёт локальный интерфейс

TL;DR

Ollama API — это HTTP-интерфейс на собственном сервере компании — запрос и ответ, а также потоковый ответ и список установленных моделей, без обращения к внешнему облаку.

После запуска Ollama на сервере компания получает адрес внутри своей сети, куда сервисы отправляют запросы по тому же принципу, что и к облачному API: текст запроса, параметры и ответ модели в структурированном виде. Порт по умолчанию из документации — 11434, а дальше маршрут настраивают под конкретный сервис. Запрос обычно содержит имя модели, сам текст и набор параметров вроде степени случайности ответа — структура похожа на облачные API, и разработчик, знакомый с одним из них, разбирается во втором за несколько минут.

  • Обычный запрос — текст на входе, ответ модели на выходе
  • Потоковый ответ — текст приходит по частям, пока модель генерирует
  • Список моделей — какие версии установлены и доступны на сервере
  • Переключение модели без изменения кода сервиса, который к ней обращается

Для команды, которая уже подключала облачный API — например, через статью про получение ключа Claude API, — структура запроса к Ollama узнаётся быстро: разница в адресе сервера и отсутствии внешней оплаты за токены.

Типовые сценарии подключения

CRM тянет черновик письма через Ollama API вместо готового шаблона — модель подставляет детали клиента и историю переписки в текст. Внутренний бот в Telegram отвечает сотрудникам по регламентам компании, а скрипт разметки тикетов присваивает тему и приоритет каждому обращению до того, как его увидит человек.

СервисЧто делает через API
CRM (amoCRM, Битрикс24)черновик письма или комментарий по сделке
Внутренний Telegram-ботответ сотруднику по регламентам и базе знаний
Скрипт разметки тикетовтема, приоритет и короткое резюме обращения
n8n или Makeузел сценария, который вызывает модель на нужном шаге

Выбор конкретного сценария зависит от того, где рождается запрос: если модель нужна внутри уже существующего сервиса, интерфейс остаётся прежним и меняется только адрес обращения. Если сценарий собирают заново, Ollama API берут отправной точкой сразу. Связка с n8n разобрана отдельно в статье про локальную установку n8n для компании — оба сервиса чаще ставят рядом, на одном сервере или в соседних контейнерах.

Совместимость и клиенты

Ollama поддерживает формат запросов, близкий к распространённому среди облачных API стилю, — готовые библиотеки и инструменты для работы с моделями чаще подключаются к ней без глубокой переделки кода. Точный список поддерживаемых полей и версий смотрите в документации проекта — она обновляется чаще любой статьи.

На практике это упрощает миграцию: сервис, написанный под один облачный API, переключают на Ollama заменой адреса и ключа доступа, а логика вокруг запроса остаётся прежней. Обратная миграция — с локальной модели обратно на облако — работает по тому же принципу. Разработчику, который уже писал код под облачный API, привычные библиотеки для работы с моделями часто подходят и здесь, с минимальной правкой адреса и параметров подключения. Ручная сборка запроса через обычный HTTP-клиент тоже работает, своими средствами и без сторонних библиотек вообще.

Безопасность и доступ

Локальный сервер снимает риск утечки через внешний канал, а собственные риски добавляет: без отдельной настройки доступ к API открыт любому устройству внутри сети компании, а иногда и за её пределами, если порт торчит наружу по ошибке.

  • Доступ только внутри локальной сети — порт закрыт от внешнего интернета
  • Список сервисов, которым разрешено обращаться к API, зафиксирован явно
  • Логирование запросов — кто, когда и с каким текстом обратился к модели
  • Отдельный технический аккаунт для каждого сервиса вместо общего доступа

Частая недоработка на старте — открытый порт без ограничения по IP-адресам: локальная сеть компании физически защищена периметром офиса, а сервер в облаке — уже своей отдельной оградой, и доступ к нему проверяют заранее, до первого рабочего запроса. Команда, которая уже настраивала доступ к внутренним сервисам компании, узнает здесь привычный набор мер — разница лишь в том, что за портом раньше обычно стояла база данных или админка, а теперь — языковая модель.

Проверка ограничения по сети выглядит конкретно: запрос с устройства вне списка разрешённых обязан получать явный отказ, а зависание без ответа означает, что фильтр настроен ошибочно.

● Discovery · 1 час · бесплатно

Планируете подключить локальную модель к своим сервисам?

Прийти на Discovery →

Проверка под нагрузкой

Одна видеокарта обрабатывает обычно один запрос за раз — параллельные обращения от нескольких сервисов встают в очередь, и это стоит учесть заранее, до подключения к рабочему процессу с потоком заявок.

  1. Отправьте несколько запросов подряд из разных сервисов и замерьте время ответа
  2. Проверьте, что очередь сохраняет старые запросы при новом входящем, без потерь
  3. Оцените время ответа на длинных запросах отдельно от коротких
  4. Сравните нагрузку на одну видеокарту с ожидаемым потоком заявок компании

Типовая ошибка на этом этапе — тестировать API с одного устройства и одним запросом за раз: очередь при этом остаётся незаметной, а на проде пять сервисов бьют в один порт одновременно. Условный пример: компания подключила Ollama API к CRM и к внутреннему боту сразу — оба сервиса запрашивают модель в один и тот же час пиковой нагрузки, и очередь удлиняется заметно быстрее, чем показывал тест с одним источником запросов.

Цель теста — узнать границу заранее, до момента, когда несколько сотрудников одновременно отправят вопрос боту в обеденный перерыв. Очередь сама по себе — нормальный режим работы одной видеокарты под несколько источников запросов, а поломкой это становится только тогда, когда время ответа расползается за пределы терпимого. Готовый запуск модели на сервере — тема отдельной статьи про запуск Ollama для компании; здесь описан следующий шаг — подключение к своим сервисам. Термин из документации — Ollama — разобран отдельно в глоссарии, а настройку контура под задачи компании обсуждаем на автоматизации бизнес-процессов.

Частые вопросы

Ollama model — как переключить модель через API без остановки сервиса?
Достаточно указать другое имя модели в теле запроса, если она уже установлена на сервере: сервис продолжает работать, а перезапуск для переключения остаётся без надобности.
Ollama api key — нужен ли ключ доступа?
У локального интерфейса своего облачного ключа нет — доступ ограничивают на уровне сети и списка разрешённых сервисов, без пароля на каждый отдельный запрос.
Можно ли подключить Ollama API к CRM напрямую?
Да, через готовый узел или простой HTTP-запрос из сценария автоматизации; CRM отправляет текст и получает черновик или разметку обратно тем же способом.
Сколько запросов держит Ollama API одновременно?
Зависит от сервера и видеокарты — типовая настройка обрабатывает запросы по очереди один за одним. Точную нагрузку проверяют тестом на своём оборудовании — общие цифры из сети здесь плохой ориентир.
Работает ли Ollama API без интернета?
Да, если модель уже установлена на сервере — обращение остаётся внутри локальной сети компании, а внешний канал для ответа тут ни при чём.
Чем Ollama API отличается от облачного API вендора?
Адресом и владельцем инфраструктуры: облачный API идёт на сервер вендора с оплатой за токены, Ollama API — на сервер компании, где платят только за само оборудование.