Когда документ разделён на части, по каждой ведётся конспект, а сверка ссылок между частями выполняется отдельным шагом, нейросеть для длинных текстов работает надёжнее. Метод годится для любой модели, потому что опирается на общее ограничение: у каждой модели есть предел окна контекста, а внимание к середине очень длинного материала слабеет. Конкретные размеры окон меняются, поэтому здесь они опущены, а метод от них практически независим.
Почему всё ломается
Длинный документ ломает работу модели тремя способами: он выходит за пределы окна, середина читается хуже начала и конца, а ссылки между далёкими частями теряются. Метод строится на борьбе с этими тремя проблемами.
Даже когда документ целиком помещается в окно модели, внимательное чтение остаётся под вопросом. Модели склонны хорошо удерживать начало и конец материала, а середину пересказывать общими словами. Отдельная беда состоит в перекрёстных ссылках: определение в первой главе, исключение в двенадцатой, и ответ требует прочитать оба места.
Поэтому подход «загрузить всё и спросить» работает лишь на коротких документах и на простых вопросах вроде «о чём это». Как только вопрос требует точности, например «какие исключения предусмотрены для поставщиков из пункта о сроках», слабые места вылезают наружу. Метод ниже превращает чтение в управляемый процесс с проверкой на каждом шаге.
- Предел окна: при превышении документ обрезается или отклоняется.
- Провал в середине: детали из центральных разделов теряются чаще, чем из краёв.
- Потеря связей: ссылки на определения, таблицы и приложения теряются при делении.
- Накопление ошибок: при многошаговой обработке небольшая неточность растёт от шага к шагу.
- Подмена содержания: модель дополняет пробелы правдоподобными выдумками.
Обзор одного конкретного продукта для больших документов есть в статье Kimi: нейросеть для работы с длинными документами. Здесь описан метод, который работает на разных моделях.
Деление на части
Делить нужно по смыслу, а число знаков вторично. Разрез посреди довода создаёт две половины, каждая из которых понимается неверно.
Размер части подбирайте так, чтобы она с запасом помещалась в окно вместе со справочным блоком и вашим заданием. Слишком большие части возвращают проблему середины, слишком мелкие дробят смысл и умножают число шагов. Практичный ориентир: часть соответствует одному-двум разделам документа, которые читатель воспринял бы как единое целое.
- Выпишите оглавление документа и определите естественные границы: главы, разделы, приложения.
- Если разделов нет, найдите смысловые стыки: смена темы, вывод, новый довод.
- Задайте каждой части номер и краткое название, они пригодятся в сводке и цитатах.
- Оставьте небольшое перекрытие между соседними частями или добавьте в начало части одно предложение о предыдущей.
- Вынесите определения, термины и таблицы с условными обозначениями в отдельный справочный блок.
- Подавайте справочный блок вместе с каждой частью, чтобы связи сохранялись.
Справочный блок решает главную проблему деления: определение из начала документа остаётся доступным при чтении любой главы. Для документов в формате PDF с таблицами и сносками подготовка описана в материале нейросеть для работы с PDF: поиск, цитаты и сверка.
Конспект разделов
По каждой части ведётся конспект фиксированного формата. Единая форма позволяет склеивать конспекты в общую картину и находить пропуски.
| Поле | Что записывается | Зачем |
|---|---|---|
| Номер и название части | Как в оглавлении | Привязка к источнику |
| Главная мысль | Одно-два предложения | Быстрый обзор |
| Факты и числа | Дословно, с указанием места | Точность |
| Определения и условия | Что введено или изменено в этой части | Связи между частями |
| Ссылки на другие части | Куда отсылает автор | Сверка на следующем шаге |
| Вопросы и неясности | Где модель сомневается | Передача человеку |
Конспект пишите по одной и той же инструкции для всех частей, а инструкцию сохраняйте вместе с результатом. Тогда конспекты разных частей сопоставимы, а при смене модели можно повторить процесс и сравнить итоги. Если инструкция менялась по ходу, пересоберите уже готовые части, иначе единая картина разваливается.
Поле для неясностей особенно ценно: разрешите модели честно писать «в этом месте текст неоднозначен» вместо выдумки. Тогда сомнения становятся видимыми, и человек проверяет именно их. Когда конспект нужно ужать под жёсткий объём, дальше действует метод из статьи нейросеть для сокращения текста.
Сверка ссылок
После конспектов выполняется отдельный проход по связям. Он отвечает на вопрос, согласуются ли части между собой: противоречит ли глава шестая главе второй, остался ли в тексте вывод, который опровергнут исключением в приложении.
- Соберите из конспектов все ссылки на определения и сверьте, что определение действительно такое.
- Проверьте числа, которые повторяются в разных частях, на совпадение.
- Найдите исключения и оговорки и убедитесь, что общие утверждения их учитывают.
- Выпишите противоречия между частями и передайте автору или эксперту.
- Составьте сводку из конспектов, минуя повторное чтение исходного текста, и проверьте, что в ней нет утверждений, которых нет в конспектах.
Особенно внимательно относитесь к таблицам, приложениям и сноскам: именно там спрятаны исключения, ради которых документ часто читают. При делении они оказываются в стороне от основного текста, и модель легко их теряет. Включайте их в справочный блок или обрабатывайте отдельным проходом с вопросом «что здесь меняет общие правила».
Сводку из конспектов удобно сравнить с оригиналом выборочно: возьмите три-четыре места, о которых модель говорит уверенно, и найдите их в тексте. Разногласия показывают, насколько можно доверять остальному. Для работы с набором файлов в целом смотрите нейросеть для файлов: как работать с документами.
Какой длинный документ в вашей компании читают реже всего, хотя он важен?
Контроль потерь
Деление и конспектирование неизбежно теряют часть содержания. Задача состоит в том, чтобы знать, что потеряно, и убедиться, что это неважно.
Вывод по длинному документу принимается, когда его ключевые утверждения подтверждены местом в оригинале: номером части и цитатой. Утверждение без указанного места считается непроверенным и выносится за пределы сводки.
Для особо ответственных документов добавьте второго читателя из людей: он выбирает несколько разделов по собственному интересу и сверяет их со сводкой. Случайный выбор разделов ловит ошибки в местах, которые вам самим вряд ли пришли бы в голову. Результат сверки записывайте так же, как и остальные проверки, с датой и именем.
- Контрольные вопросы: заранее составьте список вопросов, ответ на которые вы знаете из документа, и задайте их по итоговой сводке.
- Поиск на потери: выберите несколько важных фактов из середины документа и проверьте, дошли ли они до сводки.
- Сравнение моделей: на ответственных документах пропустите материал через две модели и разберите расхождения.
- Журнал: какая модель, какая схема деления, когда и кем проверено.
- Сдача заказчику с оговоркой: сводка дополняет оригинал и подтверждает только проверенные места.
Для анализа массива коротких текстов, например отзывов и обращений, метод другой, он описан в статье нейросеть для анализа текста: темы, тон и доказательства. Регламент работы с большими документами для команды, со схемой деления, форматом конспекта, сверкой и контрольными вопросами, входит в консалтинг по внедрению ИИ.