Qwen LoRAs — это адаптеры поверх замороженной модели, которые меняют стиль ответов и термины под задачи компании, оставляя основные веса модели без изменений. За новые факты внутри компании отвечает RAG, а LoRA меняет исключительно манеру и термины ответа, оставляя знания модели прежними. Выбор адаптера LoRA имеет смысл ровно тогда, когда промпта и RAG компании уже недостаточно для нужного стиля ответа.

Что даёт адаптер

TL;DR

LoRA для Qwen — лёгкий способ дообучения: адаптер в малую долю размера модели меняет стиль ответов и термины отрасли под компанию, а сама базовая модель остаётся без изменений.

Адаптер LoRA добавляют поверх готовой модели Qwen отдельным небольшим файлом — сама модель остаётся общей для всех задач компании, а стиль и термины конкретного отдела живут в отдельном адаптере рядом.

  • Свой стиль ответов — деловой тон юридического отдела или разговорный тон поддержки клиентов
  • Термины отрасли — названия продуктов, аббревиатуры и профессиональный жаргон компании в ответах модели
  • Формат документов — структура ответа повторяет шаблон компании без длинного описания в каждом промпте

Компания переключает адаптеры под задачу так же, как переключает вкладку в браузере — базовая модель Qwen работает одна на сервере, а разным отделам выдают разные адаптеры LoRA поверх неё.

Разные отделы редко нуждаются в одинаковом объёме дообучения — юридический отдел с устойчивым набором формулировок выигрывает от адаптера почти сразу, а отдел с быстро меняющимся ассортиментом продукта обновляет адаптер чаще, что тоже стоит закладывать в план.

Граница адаптера

У адаптера LoRA есть чёткая граница — он меняет манеру ответа модели, а знания о компании остаются на стороне RAG.

Разница с RAG разобрана в статье RAG или дообучение модели для компании — там же объяснено, когда достаточно подключить базу знаний, а когда стиль ответа требует именно адаптера.

ЗадачаРешает LoRAРешает RAG
Свой стиль и термины ответаданет
Актуальные факты о компаниинетда
Формат документа под шаблонданет

Таблица показывает разделение труда — LoRA и RAG редко заменяют друг друга, чаще работают вместе: адаптер держит стиль, а RAG подтягивает свежие факты в каждый конкретный ответ.

Путаница чаще всего возникает именно здесь — команда ждёт от адаптера LoRA новых знаний о продукте или клиентах, а получает лишь другую манеру подачи того же ответа; ожидание стоит сверять с таблицей выше ещё до начала обучения.

Смешение задач LoRA и RAG внутри одного контура — рабочая практика: адаптер задаёт тон и термины, а модуль RAG подтягивает актуальный документ или цифру прямо в момент ответа, и оба слоя настраивают независимо друг от друга.

Хранение адаптеров

Адаптеры LoRA хранят рядом с базовой моделью Qwen на своём или арендованном сервере компании — отдельный файл под каждый отдел, с пометкой даты обучения и датасета, на котором он получен.

  • Один адаптер на отдел — юридический, поддержка клиентов, продажи получают разные версии ответа поверх одной модели
  • Переключение без перезапуска базовой модели — сервер подгружает нужный адаптер под конкретный запрос
  • Версия датасета рядом с адаптером — при пересборке команда точно знает, на каких примерах обучен именно этот файл

Именование файлов адаптеров избавляет команду от поиска нужного файла позже — отдел, дата обучения и версия датасета прямо в названии файла работают надёжнее памяти сотрудника, который ставил адаптер на сервер полгода назад.

Резервная копия адаптера — вопрос общей инфраструктуры компании: команда хранит копию вне основного сервера на случай сбоя, точно так же, как хранит резервную копию любого рабочего файла.

Хранение нескольких адаптеров поверх одной модели обходится дешевле, чем отдельная копия модели под каждый отдел — оба варианта решают одну и ту же задачу, но по-разному встают на инфраструктуру компании.

Проверка результата

Результат обучения адаптера проверяют по трём точкам — сравнение с отложенными примерами, сравнение с ответом базовой модели без адаптера и оценка человеком на выборке реальных запросов.

  1. Прогнать отложенные примеры через адаптер и сверить с эталонным ответом
  2. Прогнать те же запросы через базовую модель без адаптера и сравнить разницу
  3. Отдать выборку ответов человеку из отдела, для которого обучен адаптер, на оценку по смыслу и тону

Расхождение между метрикой на отложенных примерах и оценкой сотрудника встречается регулярно: точный по формулировке ответ иногда звучит казённо для клиента, и тогда датасет обучения пересматривают в первую очередь, а саму метрику оставляют как есть.

Регулярность проверки важнее её глубины на старте — короткая выборка ответов раз в неделю на первых порах показательнее одной большой проверки раз в квартал, которую откладывают до последнего.

Оценка человеком — последний и самый надёжный шаг: метрика на отложенных примерах показывает точность формулировки, а тон и уместность ответа для конкретного отдела видит только сотрудник этого отдела. Контур с проверкой на этом этапе разбирают в рамках внедрения ИИ под задачу компании.

● Discovery · 1 час · бесплатно

Для какого отдела компании нужен свой адаптер LoRA?

Прийти на Discovery →

Где адаптер даёт сбой

  • Мало данных — короткий датасет учит адаптер частным формулировкам вместо общего стиля отдела
  • Адаптер забывает общие навыки — слишком узкий и однообразный датасет сужает ответы модели за пределами обученной темы
  • Утечка персональных данных в обучение — имена и контакты клиентов остаются в примерах, если очистку датасета пропускают

Ротация адаптеров между отделами требует общего правила хранения — без него один отдел использует чужой недоученный адаптер по ошибке, приняв его за готовую версию своего собственного.

Документированный процесс подготовки датасета — простая страховка от повторения одних и тех же провалов в следующем отделе, который берётся за свой собственный адаптер после первого успешного примера.

Спешка на этапе датасета тянет за собой все три провала сразу — разнообразие примеров и очистку от персональных данных пропускают ради скорости, а расплачиваются точностью адаптера.

// с чего начать

Возьмите один отдел с устойчивым набором формулировок, обучите под него один адаптер и отдайте на проверку человеку из этого отдела — на другие отделы контур масштабируют только после этой проверки.

Сам процесс дообучения — подготовка датасета, запуск обучения через ускоряющий инструмент и проверка на отложенных примерах — устройство разобрано в статье этой же серии Unsloth для Qwen: как дообучить модель быстрее.

Частые вопросы

Что такое LoRA для Qwen?
Адаптер поверх замороженной базовой модели Qwen, который меняет стиль ответов и термины под задачи компании, оставляя основные веса модели без изменений.
Чем LoRA отличается от RAG?
LoRA меняет манеру и стиль ответа модели, а RAG подтягивает свежие факты компании в каждый конкретный ответ — обычно оба работают вместе.
Как хранят адаптеры LoRA в компании?
Рядом с базовой моделью Qwen на своём или арендованном сервере — отдельный файл под каждый отдел с пометкой даты обучения и датасета.
Как проверить, что адаптер LoRA обучен успешно?
Сравнить ответы адаптера с отложенными примерами и с базовой моделью без адаптера, а после — отдать выборку ответов на оценку сотруднику того отдела, для которого он обучен.