Perplexity PDF работает так: вы прикладываете файл к вопросу, а сервис отвечает по тексту документа; фрагмент и страницу, на которые он опирается, вы просите назвать в самом вопросе. Для договора, отчёта или регламента это удобный первый проход: найти пункт, пересказать раздел, собрать список утверждений. Способ подходит, когда документ можно показывать облачному сервису, а решение по тексту остаётся за человеком.
Файл и веб
Вопрос по приложенному файлу и поиск по вебу — два разных режима: в первом ответ строится на тексте документа, во втором на найденных страницах. Смешивать их можно только осознанно, иначе непонятно, откуда взялась фраза.
Perplexity известен как поиск с источниками: на обычный вопрос он собирает ответ из веб-страниц и даёт ссылки. С приложенным PDF картина другая. Сервис читает документ и отвечает по его содержанию, поэтому источником становится файл. Документация Perplexity для разработчиков описывает работу с файлами в Agent API: поддерживаются PDF, DOC, DOCX, TXT и RTF, а допустимые форматы и способы подачи зависят от выбранной модели. Там же отмечено, что при передаче документа инструменты браузера недоступны: файл уходит прямо в модель. Кнопки и подписи в самом приложении меняются, поэтому порядок загрузки проверьте на своём аккаунте.
Общую картину поиска без файлов даёт статья про Perplexity для бизнеса, а условия доступа описывает разбор для российских компаний. Здесь разговор о другом: как довести один документ до проверяемого ответа. Вывод модели читайте как гипотезу о тексте. Верность гипотезы подтверждает сверка со страницей, на которую модель сослалась.
Практическое следствие касается формулировок. Фраза «найди в интернете» включает веб-поиск и отдаёт вам чужие страницы, а фраза «по приложенному файлу» удерживает ответ внутри документа. Если нужны и документ, и внешняя проверка, разнесите их на два вопроса: сначала выписка из файла, затем отдельный поиск по вебу с пометкой, что проверяется утверждение из выписки. Тогда в журнале видно, какой ответ откуда пришёл.
Подготовка файла
Качество ответа начинается до загрузки. Откройте PDF и попробуйте выделить мышью любую строку. Выделяется — у файла есть текстовый слой, и сервис читает буквы. Выделить нельзя — перед вами скан в виде картинок: тексту сначала нужно распознавание, а результат распознавания проверяют глазами. Про смежный путь с проверкой макета рассказывает статья про перевод PDF и сверку результата.
- Текстовый слой: выделяется ли строка, читается ли таблица. Скан без распознавания даёт пустые или рваные ответы.
- Размер: длинный документ режьте по разделам и называйте файлы по диапазонам страниц, чтобы цитату легко найти.
- Персональные данные: фамилии, телефоны и реквизиты замените метками до загрузки. Облачному сервису хватает обезличенного фрагмента.
- Версия: храните рядом дату и название файла, с которым работали. Через месяц документ обновится, а ответ останется про старую редакцию.
Полные данные обрабатывает ваш скрипт или ваша система: таблицы с суммами, реестры, выгрузки. Модели отдают текстовый фрагмент для объяснения. Пересчёт итогов и сверка реквизитов — задача программы и человека, а пересказ раздела — задача модели. Такое разделение избавляет от ситуации, когда уверенный абзац подменяет арифметику.
Отдельно посмотрите на таблицы. В текстовом PDF таблица нередко превращается в строки без границ, и модель склеивает соседние ячейки. Для таблиц с суммами возьмите исходную выгрузку из учётной системы и работайте с ней скриптом, а PDF оставьте для текстовых пунктов. Если таблицу всё же нужно прочитать, попросите вывести её построчно с номером страницы и сверьте две-три ячейки с оригиналом.
Вопросы к документу
Хороший вопрос по файлу короткий и привязан к одному пункту. Общая просьба «расскажи, что в документе» возвращает гладкий пересказ, в котором легко потерять оговорку. Четыре шага ниже дают список цитат вместо пересказа.
- Начните с карты: попросите перечислить разделы документа и страницы, где они находятся. Сверьте ответ с оглавлением файла.
- Задайте узкий вопрос: «Какой срок оплаты указан в разделе о расчётах? Приведи цитату и номер страницы». Один вопрос — один пункт документа.
- Попросите разделить сказанное в документе и вывод: сначала дословные цитаты, затем ваш комментарий отдельным абзацем.
- Спросите о пробелах: «Каких условий в документе нет?» Ответ «такого условия в тексте нет» полезнее выдуманного пункта.
Повторяйте вопрос другими словами. Если на два разных вопроса про один пункт приходят две разные цитаты, документ либо длинный и модель выбрала другой фрагмент, либо формулировка пункта допускает два прочтения. Обе ситуации требуют внимания человека.
Представьте закупщика, который перед созвоном с поставщиком ищет условия приёмки в договоре. После четырёх шагов у него на руках готового вывода нет, зато есть перечень цитат с номерами страниц. Именно этот перечень и уходит на сверку.
Какой документ в вашей компании читают дольше всего?
Сверка цитаты
Цитата может звучать правдоподобно и принадлежать другой странице либо другой редакции. Поэтому сверка идёт по самому PDF, а текст чата служит подсказкой. Таблица показывает, что делает человек при каждом типе ответа.
| Что видим в ответе | Что делает человек | Решение |
|---|---|---|
| Цитата с номером страницы | Открывает страницу и ищет эту фразу | Совпало дословно — берём, расходится — отбрасываем |
| Пересказ без цитаты | Просит дать фрагмент или ищет сам | Без фрагмента утверждение остаётся гипотезой |
| Число или дата | Сверяет с таблицей в исходнике | Расчёты ведёт скрипт, модель лишь указывает место |
| Ссылка на сайт вместо файла | Проверяет, в каком режиме задан вопрос | Для вопроса по документу ответ опирается на файл |
| Ответ «в документе такого нет» | Ищет по ключевым словам вручную | Отсутствие подтверждается поиском по тексту |
Тот же принцип описан для собственных систем в статье про тест цитат в прототипе RAG: ответ принимается, когда цитата находится в источнике. Для Perplexity правило переносится один в один. Если сервис ссылается на страницу, а фразы на ней нет, вся цепочка рассуждений вокруг этой цитаты считается непроверенной.
Ведите короткий журнал сверки: вопрос, цитата, страница, результат поиска фразы в файле. Через неделю по нему видно, на каких типах документов сервис ошибается чаще. Одним документам хватает быстрого просмотра, другие, например договоры с приложениями, требуют сверки каждой цитаты.
Допуск в работу
Перед запуском для команды прогоните пять-семь реальных, но обезличенных документов разных видов. Считайте три показателя: сколько цитат совпало дословно, сколько раз сервис честно признал пробел и сколько раз выдал факт без опоры на текст. Порог допуска задаёт владелец процесса. Если хоть один пункт с юридическими последствиями проходит без сверки, правило нужно переписать.
Вопрос доступа решайте до пилота. У Perplexity прямая оплата российской картой недоступна, поэтому заранее определите, на каком аккаунте работает команда и кто вправе загружать файлы. Для документов с коммерческой тайной сначала опишите контур по образцу статьи про архитектуру и доступы корпоративной нейросети.
Роли распределите заранее. Один сотрудник готовит файл и вопросы, второй сверяет цитаты, владелец процесса принимает решение по спорным примерам. Когда готовит и проверяет один человек, ошибки подготовки остаются незамеченными. Для небольшой команды хватает двух ролей, лишь бы проверяющий открывал страницу документа сам.
Возьмите один обезличенный документ и составьте три вопроса, ответы на которые вы уже знаете. Загрузите файл, получите ответы и отметьте, где цитата совпала дословно. Если нужен регламент для всей команды, обсудите с нами работу нейросети с вашими документами; состав работ определим после знакомства с задачей.