Perplexity PDF работает так: вы прикладываете файл к вопросу, а сервис отвечает по тексту документа; фрагмент и страницу, на которые он опирается, вы просите назвать в самом вопросе. Для договора, отчёта или регламента это удобный первый проход: найти пункт, пересказать раздел, собрать список утверждений. Способ подходит, когда документ можно показывать облачному сервису, а решение по тексту остаётся за человеком.

Файл и веб

TL;DR

Вопрос по приложенному файлу и поиск по вебу — два разных режима: в первом ответ строится на тексте документа, во втором на найденных страницах. Смешивать их можно только осознанно, иначе непонятно, откуда взялась фраза.

Perplexity известен как поиск с источниками: на обычный вопрос он собирает ответ из веб-страниц и даёт ссылки. С приложенным PDF картина другая. Сервис читает документ и отвечает по его содержанию, поэтому источником становится файл. Документация Perplexity для разработчиков описывает работу с файлами в Agent API: поддерживаются PDF, DOC, DOCX, TXT и RTF, а допустимые форматы и способы подачи зависят от выбранной модели. Там же отмечено, что при передаче документа инструменты браузера недоступны: файл уходит прямо в модель. Кнопки и подписи в самом приложении меняются, поэтому порядок загрузки проверьте на своём аккаунте.

Общую картину поиска без файлов даёт статья про Perplexity для бизнеса, а условия доступа описывает разбор для российских компаний. Здесь разговор о другом: как довести один документ до проверяемого ответа. Вывод модели читайте как гипотезу о тексте. Верность гипотезы подтверждает сверка со страницей, на которую модель сослалась.

Практическое следствие касается формулировок. Фраза «найди в интернете» включает веб-поиск и отдаёт вам чужие страницы, а фраза «по приложенному файлу» удерживает ответ внутри документа. Если нужны и документ, и внешняя проверка, разнесите их на два вопроса: сначала выписка из файла, затем отдельный поиск по вебу с пометкой, что проверяется утверждение из выписки. Тогда в журнале видно, какой ответ откуда пришёл.

Подготовка файла

Качество ответа начинается до загрузки. Откройте PDF и попробуйте выделить мышью любую строку. Выделяется — у файла есть текстовый слой, и сервис читает буквы. Выделить нельзя — перед вами скан в виде картинок: тексту сначала нужно распознавание, а результат распознавания проверяют глазами. Про смежный путь с проверкой макета рассказывает статья про перевод PDF и сверку результата.

  • Текстовый слой: выделяется ли строка, читается ли таблица. Скан без распознавания даёт пустые или рваные ответы.
  • Размер: длинный документ режьте по разделам и называйте файлы по диапазонам страниц, чтобы цитату легко найти.
  • Персональные данные: фамилии, телефоны и реквизиты замените метками до загрузки. Облачному сервису хватает обезличенного фрагмента.
  • Версия: храните рядом дату и название файла, с которым работали. Через месяц документ обновится, а ответ останется про старую редакцию.

Полные данные обрабатывает ваш скрипт или ваша система: таблицы с суммами, реестры, выгрузки. Модели отдают текстовый фрагмент для объяснения. Пересчёт итогов и сверка реквизитов — задача программы и человека, а пересказ раздела — задача модели. Такое разделение избавляет от ситуации, когда уверенный абзац подменяет арифметику.

Отдельно посмотрите на таблицы. В текстовом PDF таблица нередко превращается в строки без границ, и модель склеивает соседние ячейки. Для таблиц с суммами возьмите исходную выгрузку из учётной системы и работайте с ней скриптом, а PDF оставьте для текстовых пунктов. Если таблицу всё же нужно прочитать, попросите вывести её построчно с номером страницы и сверьте две-три ячейки с оригиналом.

Вопросы к документу

Хороший вопрос по файлу короткий и привязан к одному пункту. Общая просьба «расскажи, что в документе» возвращает гладкий пересказ, в котором легко потерять оговорку. Четыре шага ниже дают список цитат вместо пересказа.

  1. Начните с карты: попросите перечислить разделы документа и страницы, где они находятся. Сверьте ответ с оглавлением файла.
  2. Задайте узкий вопрос: «Какой срок оплаты указан в разделе о расчётах? Приведи цитату и номер страницы». Один вопрос — один пункт документа.
  3. Попросите разделить сказанное в документе и вывод: сначала дословные цитаты, затем ваш комментарий отдельным абзацем.
  4. Спросите о пробелах: «Каких условий в документе нет?» Ответ «такого условия в тексте нет» полезнее выдуманного пункта.

Повторяйте вопрос другими словами. Если на два разных вопроса про один пункт приходят две разные цитаты, документ либо длинный и модель выбрала другой фрагмент, либо формулировка пункта допускает два прочтения. Обе ситуации требуют внимания человека.

Представьте закупщика, который перед созвоном с поставщиком ищет условия приёмки в договоре. После четырёх шагов у него на руках готового вывода нет, зато есть перечень цитат с номерами страниц. Именно этот перечень и уходит на сверку.

● Discovery · 1 час · бесплатно

Какой документ в вашей компании читают дольше всего?

Прийти на Discovery →

Сверка цитаты

Цитата может звучать правдоподобно и принадлежать другой странице либо другой редакции. Поэтому сверка идёт по самому PDF, а текст чата служит подсказкой. Таблица показывает, что делает человек при каждом типе ответа.

Что видим в ответеЧто делает человекРешение
Цитата с номером страницыОткрывает страницу и ищет эту фразуСовпало дословно — берём, расходится — отбрасываем
Пересказ без цитатыПросит дать фрагмент или ищет самБез фрагмента утверждение остаётся гипотезой
Число или датаСверяет с таблицей в исходникеРасчёты ведёт скрипт, модель лишь указывает место
Ссылка на сайт вместо файлаПроверяет, в каком режиме задан вопросДля вопроса по документу ответ опирается на файл
Ответ «в документе такого нет»Ищет по ключевым словам вручнуюОтсутствие подтверждается поиском по тексту

Тот же принцип описан для собственных систем в статье про тест цитат в прототипе RAG: ответ принимается, когда цитата находится в источнике. Для Perplexity правило переносится один в один. Если сервис ссылается на страницу, а фразы на ней нет, вся цепочка рассуждений вокруг этой цитаты считается непроверенной.

Ведите короткий журнал сверки: вопрос, цитата, страница, результат поиска фразы в файле. Через неделю по нему видно, на каких типах документов сервис ошибается чаще. Одним документам хватает быстрого просмотра, другие, например договоры с приложениями, требуют сверки каждой цитаты.

Допуск в работу

Перед запуском для команды прогоните пять-семь реальных, но обезличенных документов разных видов. Считайте три показателя: сколько цитат совпало дословно, сколько раз сервис честно признал пробел и сколько раз выдал факт без опоры на текст. Порог допуска задаёт владелец процесса. Если хоть один пункт с юридическими последствиями проходит без сверки, правило нужно переписать.

Вопрос доступа решайте до пилота. У Perplexity прямая оплата российской картой недоступна, поэтому заранее определите, на каком аккаунте работает команда и кто вправе загружать файлы. Для документов с коммерческой тайной сначала опишите контур по образцу статьи про архитектуру и доступы корпоративной нейросети.

Роли распределите заранее. Один сотрудник готовит файл и вопросы, второй сверяет цитаты, владелец процесса принимает решение по спорным примерам. Когда готовит и проверяет один человек, ошибки подготовки остаются незамеченными. Для небольшой команды хватает двух ролей, лишь бы проверяющий открывал страницу документа сам.

// с чего начать

Возьмите один обезличенный документ и составьте три вопроса, ответы на которые вы уже знаете. Загрузите файл, получите ответы и отметьте, где цитата совпала дословно. Если нужен регламент для всей команды, обсудите с нами работу нейросети с вашими документами; состав работ определим после знакомства с задачей.

Частые вопросы

Можно ли загрузить PDF в Perplexity?
Да, Perplexity работает с документами, приложенными к вопросу. В Agent API для разработчиков поддерживаются PDF, DOC, DOCX, TXT и RTF, а формат и способ подачи зависят от выбранной модели. Порядок загрузки в приложении проверьте на своём аккаунте.
Как получить цитату страницы из PDF?
Попросите в самом вопросе дословную цитату и номер страницы, а комментарий пусть идёт отдельным абзацем. Затем откройте указанную страницу и найдите фразу. Совпала дословно — цитата годится, расходится — отбросьте её.
Почему Perplexity путает текст в отсканированном PDF?
У скана нет текстового слоя: файл содержит картинки страниц. Сначала нужно распознавание, а его результат проверяют глазами. Быстрый тест: если строку в PDF нельзя выделить мышью, это скан.
Можно ли загружать договор в Perplexity?
Решение зависит от политики вашей компании и условий сервиса. Обезличьте фамилии и реквизиты, загрузите нужный раздел вместо всего файла и держите полные данные в своей системе. Для коммерческой тайны согласуйте допуск с владельцем процесса.
Чем вопрос по PDF отличается от обычного поиска Perplexity?
Обычный поиск собирает ответ из веб-страниц со ссылками, а вопрос по файлу строится на тексте документа. В каждом ответе проверяйте, на что указывает источник: на файл или на сайт.