ollama pull скачивает модель из реестра на ваш компьютер или сервер, и самое важное в этой команде происходит вокруг неё: какой тег вы указали, где лежит результат, сколько места он занял и как вернуться к прежнему варианту, если новый ответил хуже. Первый запуск Ollama здесь оставлен за скобками: речь о том, как держать набор моделей в порядке на рабочей машине, где ими пользуется команда.

Что делает pull

TL;DR

pull загружает модель на диск, дальше работают остальные команды: список, запуск, остановка, удаление, создание собственного варианта. Управление версиями строится вокруг тега, который вы указываете явно.

По справке Ollama, командная строка включает несколько действий с моделями: загрузка, запуск, список, удаление, просмотр запущенных, остановка, создание собственной модели и запуск самого сервера. Для порядка в рабочем наборе вам нужны почти все из них, и полезно знать, какая команда отвечает за какой вопрос.

Команда pull простая, а вокруг неё складывается вполне взрослая дисциплина. На личном компьютере вы можете загрузить что угодно и забыть, но на рабочей машине, где к модели обращаются коллеги и сервисы, неожиданная замена версии превращается в инцидент: ответы меняются, тесты перестают проходить, а причину приходится долго искать.

ВопросКомандаЧто показывает или делает
Какие модели у меня загруженыlsСписок моделей на диске
Какие модели сейчас работаютpsЗагруженные в память модели
Как загрузить модельpullСкачивает модель по имени и тегу
Как освободить местоrmУдаляет модель с диска
Как выгрузить из памятиstopОстанавливает работающую модель
Как сделать свой вариантcreateСобирает модель из описания

Базовый сценарий запуска для компании описан в статье Ollama: как запустить локальную модель для компании, а подключение к собственным сервисам по сети — в материале Ollama API: как подключить локальную модель к своим сервисам.

Тег и версия

Имя модели без уточнения указывает на вариант по умолчанию, и этот вариант может меняться со временем. Для рабочей среды такая неопределённость опасна: сегодня вы получили одну модель, а после очередной загрузки на другой машине другую.

Тег обычно складывается из размера модели и варианта сжатия, и оба параметра влияют на результат. Размер определяет требования к памяти и качество рассуждений, сжатие влияет на скорость и точность. Поэтому запись тега в документе проекта — часть описания системы наравне с версией языка программирования и списком зависимостей.

  • Указывайте тег явно: размер и вариант сжатия должны быть написаны в команде, без права на умолчание.
  • Записывайте тег в общий документ и в инструкцию установки, чтобы все получали одно и то же.
  • Проверяйте карточку модели в реестре: источник, лицензия, описание изменений.
  • Обновляйте модель на рабочей машине только после теста: новая версия способна ответить иначе на тех же запросах.
  • Для проектов с жёсткими требованиями фиксируйте версию в файле конфигурации проекта.

Справка в просмотренных разделах умалчивает о том, как ведёт себя повторный pull уже загруженной модели, поэтому проверьте это поведение на тестовой машине, прежде чем строить на нём правила обновления. Подбор размера под ваши задачи показан в статье Qwen через Ollama: как выбрать размер и проверить на своих задачах.

Хранение на диске

Модели занимают много места, и по умолчанию они лежат в каталоге пользователя. Справка называет путь для каждой системы: на macOS и Windows это каталог внутри домашней папки пользователя, на Linux каталог под системным пользователем службы. Место для хранения меняют переменной окружения, которая указывает другой каталог.

Ошибка, которую делают чаще всего: оставить хранилище на системном диске с ограниченным местом. Когда место кончается, загрузка обрывается, а иногда ломается и работа остальных программ. Стоит заранее решить, где живёт каталог моделей, и настроить оповещение о заполнении диска.

  • Заранее проверьте свободное место: несколько моделей быстро заполняют небольшой системный диск.
  • Для сервера выделите отдельный диск или раздел и задайте путь переменной окружения.
  • На Linux при стандартной установке у пользователя службы должны быть права чтения и записи в новом каталоге.
  • Резервную копию делайте только для собственных вариантов моделей: стандартные загружаются заново.
  • Раз в квартал просматривайте список и удаляйте лишнее, забытое всеми.

Для запуска в контейнере вопросы хранения решаются иначе: каталог моделей выносится в том, чтобы загрузки пережили пересоздание контейнера. Это подробно разобрано в статье Ollama Docker: локальный сервер, модель и хранение данных.

Проверка после загрузки

Загрузка завершилась без ошибок, но годность модели к работе остаётся под вопросом до проверки. Проверка короткая и экономит долгие расследования, поэтому её делают всегда, даже когда загрузка шла гладко.

  1. Выведите список моделей и убедитесь, что нужный тег присутствует.
  2. Запустите модель коротким безобидным запросом и посмотрите, отвечает ли она на нужном языке.
  3. Прогоните свой контрольный набор вопросов на русском и сверьте ответы с записанными эталонами.
  4. Проверьте, помещается ли модель в память: по списку запущенных моделей видно, использует ли она ускоритель.
  5. Запишите результат: тег, дата, источник, итог теста, кто проверил.
  6. Сообщите команде, что вариант допущен, и укажите точную команду загрузки.

Проверку ускорения на видеокарте и выбор модели под неё разобраны в материале Ollama GPU: проверка ускорения и выбор модели.

● Discovery · 1 час · бесплатно

Кто в вашей команде отвечает за набор локальных моделей на рабочих машинах?

Прийти на Discovery →

Откат и свои модели

Откат возможен только тогда, когда предыдущий вариант сохранён. Поэтому перед заменой модели сделайте копию рабочей под другим именем или оставьте старый тег загруженным, до успешного теста нового.

// условие допуска

Новая версия модели попадает на рабочие машины после теста на контрольном наборе. До этого прежний вариант остаётся на диске и доступен для возврата одной командой.

Журнал изменений может быть очень простым: строка с датой, тегом, причиной и фамилией того, кто принял решение. Когда через полгода кто-то спросит, почему ответы стали другими, такая строка заменит долгое расследование. Храните журнал рядом с файлом инструкции по установке.

  • Команда cp делает копию модели под другим именем: так текущий вариант сохраняется на время теста новой версии.
  • Собственная модель собирается из файла весов через описание и команду создания, и тогда версию определяете вы.
  • Ollama при импорте GGUF квантизацию пропускает: файл готовят заранее внешними средствами.
  • Старые теги удаляйте только после того, как новый показал себя на реальных задачах на протяжении полноценного рабочего периода.
  • Каждое изменение записывайте в журнал: что заменено, зачем, кто решил.

Импорт файла GGUF в другой локальный инструмент описан в статье LM Studio GGUF: импорт модели и проверка весов. Регламент ведения набора локальных моделей для команды, с тегами, местами хранения, тестами и порядком обновления, входит в консалтинг по внедрению ИИ.

Частые вопросы

Что делает команда ollama pull?
Загружает модель из реестра на диск по имени и тегу. После этого модель можно запускать, смотреть в списке, останавливать и удалять.
Почему важно указывать тег?
Имя без тега указывает на вариант по умолчанию, который со временем может меняться. Явный тег снижает риск, что на машинах команды окажутся разные модели.
Где Ollama хранит модели?
В каталоге внутри домашней папки пользователя на macOS и Windows и в каталоге службы на Linux. Место меняют переменной окружения, указывающей другой каталог.
Как откатиться на прежнюю версию модели?
Сохранить рабочий вариант копией под другим именем или оставить старый тег загруженным, пока новый проходит тест. Откат невозможен, если прежний вариант удалён.
Нужно ли проверять модель после загрузки?
Да. Загрузка без ошибок о качестве ответов пока молчит. Проверяют язык, контрольные вопросы, использование ускорителя и записывают результат.