В режиме RAG программа LM Studio отвечает по вашим документам локальной моделью: вы прикрепляете файлы к чату, программа подбирает подходящие фрагменты и передаёт их модели вместе с вопросом, а сами файлы остаются на компьютере. Короткий документ приложение способно целиком положить в запрос, длинный разбирается по частям. Предел режима наступает, когда документов сотни, а у пользователей разные права доступа.
Файлы в чате
LM Studio позволяет прикрепить к чату файлы формата PDF, DOCX или TXT и задавать вопросы по ним локальной моделью. Если документ помещается в контекст, его передают целиком, иначе модели отдаются найденные фрагменты. Про лимиты на число и размер файлов справка LM Studio молчит, поэтому их проверяют на своих документах.
Работа строится на идее RAG: прежде чем отвечать, система находит в документах места, близкие к вопросу, и показывает их модели как опору. Если идея знакома лишь отчасти, начните со статьи про RAG в компании, а здесь мы остаёмся на уровне конкретной программы.
Главное преимущество в приватности: модель запускается на вашем компьютере, и файлы покидают его только в случае, когда вы сами подключили внешний сервис. Страница справки про чат с документами о приватности молчит, поэтому для чувствительных материалов сверьтесь с политикой конфиденциальности LM Studio. Для договоров, внутренних регламентов и черновиков это снимает часть вопросов к политике безопасности. Общий запуск моделей и устройство программы описаны в статье про LM Studio для работы с локальными моделями, пересказывать его здесь незачем.
Условный пример: юрист небольшой компании хочет быстро находить в десяти типовых договорах условия о сроках оплаты и ответственности. Он загружает файлы в чат и спрашивает по каждому пункту отдельно. Ответ модели ему нужен как указатель на место в документе, а вывод он делает сам, прочитав абзац целиком. Так режим экономит поиск, но сохраняет за человеком главную часть работы.
Опираться стоит на справку разработчика: интерфейс и поддерживаемые форматы меняются от версии к версии, поэтому перед пилотом откройте справку LM Studio про чат с документами и проверьте, что она актуальна для вашей сборки.
Что загружать
Качество ответа определяется источниками сильнее, чем моделью. Из хорошо подготовленного набора скромная модель достанет нужное, а из свалки сканов даже крупная вернёт расплывчатый ответ. Подготовка занимает меньше времени, чем кажется, если идти по списку.
- Текстовый слой. Сканы без распознавания дают программе одну картинку: сначала пропустите их через OCR и убедитесь, что текст выделяется мышью.
- Один документ — одна тема. Сборник на двести страниц с разными разделами тяжелее искать, чем набор из нескольких коротких файлов с понятными названиями.
- Актуальные версии. Старый регламент рядом с новым даст противоречивые цитаты, поэтому архивные файлы оставьте за пределами рабочей папки.
- Понятные заголовки и нумерация. Структура помогает находить фрагменты и позже проверять цитату по месту в документе.
- Без лишнего. Личные данные и сведения, к которым у пользователя нет прав, остаются за пределами общего набора.
Если материалов много и нужна общая база с правами доступа, одного приложения для поиска по файлам мало. Для такого случая подходят отдельные решения, о которых мы рассказываем на странице про нейросети для документов.
Порядок работы
- Загрузите модель, подходящую по размеру вашему компьютеру, и откройте новый чат: так прежние диалоги останутся отдельно от проверки.
- Прикрепите нужные файлы к чату и дождитесь, пока программа их обработает, и только потом задавайте вопрос.
- Формулируйте вопрос конкретно и называйте слова, которые ожидаете найти в источнике: «Какие сроки согласования указаны в регламенте закупок?» работает лучше, чем «Расскажи про закупки». Такой совет дают и в справке LM Studio.
- Попросите модель привести цитату и указать, в каком файле она найдена. Это превращает ответ в проверяемое утверждение.
- Откройте файл и сверьте цитату с оригиналом. Расхождение значит, что модель пересказала близко к тексту, но неточно, либо добавила от себя.
Название файла тоже работает как подсказка: «регламент-закупок-актуальный» помогает и человеку, и поиску лучше, чем «scan0045». Переименуйте материалы до загрузки, и цитаты из ответа будет проще сопоставлять с источником.
Следите за размером контекста, который выставлен для модели. Если он мал, программа вынуждена брать меньше фрагментов, и ответ строится на более узкой выборке. Увеличение контекста потребует больше памяти, поэтому настройку подбирают вместе с размером модели, ориентируясь на вашу машину. Если после увеличения компьютер начал тормозить, вернитесь на ступень назад и уточняйте вопросы, вместо того чтобы расширять объём.
Для сравнения качества прогоните один и тот же вопрос на двух моделях разного размера. Часто выясняется, что меньшая справляется с поиском фактов, а крупная нужна лишь там, где требуется связный вывод из нескольких мест документа.
Если ответа в файлах нет, хорошая настройка заставляет модель так и сказать. Проверьте это отдельным вопросом: спросите о том, чего в документах заведомо нет, и посмотрите, придумает ли модель ответ или признает отсутствие данных.
Проверка ответа
Ответ локальной модели с опорой на файлы выглядит убедительно даже тогда, когда ошибочен. Поэтому проверка встроена в процесс, а доверие растёт постепенно, по результатам на ваших материалах.
| Что проверяем | Как | Признак проблемы |
|---|---|---|
| Цитата из источника | Находим фразу в документе поиском по тексту | Фразы в документе нет или смысл иной |
| Цифры и даты | Сверяем с оригиналом построчно | Значение изменилось или перепутано с соседним |
| Полнота | Спрашиваем то же другими словами | Ответы расходятся между формулировками |
| Отсутствие данных | Задаём вопрос без ответа в файлах | Модель выдаёт уверенный выдуманный ответ |
| Работа с длинным файлом | Спрашиваем про конец и середину документа | Отвечает только по началу |
Последняя строка таблицы важна для длинных документов: если файл разбит на фрагменты, а поиск выбирает лишь часть, ответ строится по ограниченной выборке. Для критичных вопросов, например по условиям договора, любой ответ модели считается подсказкой, а окончательное чтение оригинала остаётся за человеком.
По каким документам вам нужен проверяемый ответ?
Границы режима
LM Studio хорошо подходит для личной работы и небольшой группы: быстро проверить гипотезу, разобрать несколько документов, показать коллегам, как выглядит локальный поиск. Дальше начинаются ограничения, которые видны сразу.
Выбирайте отдельную систему поиска, если документов много, их нужно обновлять автоматически, у пользователей разные права, а ответы должны сопровождаться журналом обращений. Приложение для одного компьютера эти требования закрывает лишь частично.
Проверка режима укладывается в небольшой пилот: десяток своих документов, двадцать вопросов с заранее известными ответами, подсчёт верных. Если верных большинство, для личной работы режима хватает, а если нет, смотрите разбор базы знаний на RAG. Загрузка всей папки разом и оценка по первому ответу дают ложную картину.