ИИ для перевода пдф работает через извлечение текста, перевод по согласованному глоссарию и сборку документа с проверкой каждой страницы. Скану сначала нужно распознавание, а текстовому PDF — разбор структуры. Для юридически значимого документа итоговую редакцию утверждает профильный специалист.
Что внутри файла
Для перевода PDF сначала определяют текстовый слой или скан; затем связывают каждый фрагмент перевода с исходной страницей и проверяют собранный макет.
Откройте файл и попробуйте выделить абзац мышью. Если текст копируется в правильном порядке, перед вами документ с текстовым слоем. Если копируется бессвязный набор символов или ничего, потребуется OCR. Плотные таблицы, боковые сноски и двухколоночная вёрстка осложняют извлечение даже при видимом текстовом слое. Условие успеха — сохранить координату или хотя бы номер страницы и тип блока для каждого фрагмента.
Общий выбор между машинным и профессиональным переводом рассмотрен в материале о переводе документов. Для PDF отдельная проблема состоит в обратной сборке: переведённая фраза часто длиннее исходной, поэтому подпись уходит под рисунок, а таблица расползается. Проект перевода сразу планируйте как работу с содержанием и макетом. Если файл нужен лишь для чтения внутри команды, требования к оформлению могут быть мягче, чем для публикации.
- Определите текстовый слой, скан или смешанный файл.
- Сосчитайте страницы, таблицы, подписи и сноски.
- Сохраните оригинал и рабочую копию с раздельными правами доступа.
Смешанный файл требует постраничной проверки: одни листы содержат текст, другие являются сканами приложений. Единый способ извлечения для всего файла здесь может пропустить важные подписи.
Карта фрагментов
Разбейте документ на блоки: заголовок, абзац, ячейка таблицы, подпись к рисунку, сноска. Присвойте каждому устойчивый идентификатор с номером страницы. Такой список нужен, чтобы при сборке сохранить мелкий текст и быстро проверить перевод спорной фразы. Для сканов примените OCR, а результат распознавания сравните с изображением на страницах, где встречаются цифры, реквизиты и специализированные термины.
- Извлеките текстовый слой; скан сначала пропустите через OCR с сохранением привязки к странице.
- Составьте двуязычный глоссарий имён, терминов, единиц измерения и допустимых сокращений.
- Передайте модели блоки с идентификаторами и попросите вернуть перевод в том же порядке.
- Соберите PDF и просмотрите страницы рядом с оригиналом при одинаковом масштабе.
Разбор сканов описан в инструкции по извлечению данных из сканов. Для перевода следующий шаг шире: исправленный текст надо вернуть в документ, сохранив подписи и ячейки. Инструмент для редактирования PDF выбирайте по доступности исходного макета. Если есть исходный файл в редакторе, править его обычно удобнее, чем перерисовывать готовый PDF.
Модель вроде GigaChat или YandexGPT может помочь с терминологией, если доступ к содержимому согласован. При выборе сервиса уточните место и условия обработки документа. Модель с открытыми весами можно разместить в согласованном контуре при подходящей инфраструктуре. Выбор зависит от конфиденциальности файла и качества перевода нужной языковой пары.
Термины и таблицы
Перевод длинного PDF ведите по общему глоссарию для всех страниц. Термин из начала договора должен означать то же самое в приложении. Включите в словарь предметные понятия, должности, названия разделов и обозначения в таблицах. Укажите, что остаётся без перевода: артикулы, коды, номера документов, имена продуктов. Оценивайте согласованность терминов и ясность языка.
| Элемент | Риск | Проверка |
|---|---|---|
| Таблица | Текст вышел за границы ячейки | Сравнить строки и единицы |
| Подпись | Потеряна связь с рисунком | Сверить номер и страницу |
| Сноска | Пропущено условие | Проверить маркер в тексте |
| Термин | Разные варианты перевода | Сверить с глоссарием |
Числа требуют отдельного просмотра. Разделитель дробной части, пробелы в тысячах и обозначения единиц меняются между языками. Модель может перевести слово рядом с числом, но порядок знаков и значение должны совпасть с оригиналом. В таблицах полезно проверять первую и последнюю строки на каждой странице, а также все ячейки с суммами и процентами. Если таблица разрезана переносом страницы, связь заголовка с продолжением надо восстановить вручную.
Для регулярной обработки большого архива пригодится работа с нейросетями для документов с журналом версий и утверждением перевода. Главный результат проверки — возможность открыть страницу оригинала по любому фрагменту итогового текста.
Перед сборкой итогового файла согласуйте самые спорные термины с владельцем документа. Исправление глоссария на этом этапе дешевле повторной вёрстки всего файла.
Сборка макета
На этапе вёрстки сравнивайте страницы попарно. Проверьте разрывы абзацев, переносы слов, положение печатей и подписей, попадание текста в поля формы. Переполнение особенно заметно в узких колонках и в подписях под изображениями. Для публичного документа дополнительно проверьте читаемость после печати и поиска по тексту: красивый снимок страницы без текстового слоя мешает дальнейшей работе.
Условный пример: инструкция содержит таблицу параметров и рисунок со стрелками. Перевод ячеек верен, но длинные русские подписи перекрывают стрелки. Решение здесь редакторское: сократить формулировку по утверждённому термину, расширить подпись или изменить размещение элемента. Перезапуск перевода всего документа оставит проблему макета. Для сложных форм привлеките специалиста по вёрстке раньше финального согласования.
Для пробного прохода выберите страницы с таблицей, рисунком и сноской. Они быстрее покажут, выдерживает ли выбранный способ извлечения и сборки реальную структуру документа.
Юридически значимый перевод перед публикацией читает профильный специалист. Он проверяет смысл обязательств, термины и соответствие оригиналу; техническая сверка макета дополняет эту работу. Отметьте в финальной версии, кто согласовал содержание и кто проверил оформление. Один человек может выполнять обе роли при наличии компетенции, но обе проверки должны быть явными.
Если исходный шрифт отсутствует в редакторе, заранее выберите замену с похожей шириной. Это снижает объём ручной перестройки строк и помогает сохранить последовательность страниц.
Если проверка выявила потери в макете, согласуйте с владельцем документа способ исправления до выдачи файла.
Какой PDF вашей команде важно перевести с сохранением макета?
Приёмка перевода
Сделайте ведомость страниц: все страницы оригинала на месте, таблицы и сноски сохранены, ссылки ведут в правильные разделы, нумерация сохранилась. Затем проверьте выборку длинных абзацев на смысл, а все ключевые термины — по глоссарию. Для важных документов выборка бывает недостаточной: специалист читает полный текст. Показатель качества для пилота — число пропущенных элементов и исправлений терминов после ручной приёмки.
Когда источник обновится, сохранённые идентификаторы блоков помогут переводить только изменённые места и видеть, какие страницы требуют новой вёрстки. Архивируйте оригинал, глоссарий, рабочий файл и утверждённый PDF. Так следующий сотрудник поймёт, какой термин выбран намеренно, а где решение ещё открыто. Устраняйте ошибки распознавания в исходном тексте до перевода, иначе неверный символ пройдёт через весь процесс.
Поиск и цитирование внутри PDF описаны в материале про работу с PDF. Перевод предъявляет дополнительное требование: содержание должно вернуться в пригодный для чтения и согласования документ. Финальный PDF принимают по двум осям — смысл и визуальная целостность; успех по одной оси требует проверки другой.
- Проверьте навигацию, номера страниц и ссылки.
- Приложите согласованный глоссарий к итоговой версии.
- Зафиксируйте замечания по конкретным страницам и блокам.
При передаче финального файла укажите, какие места специалист правил вручную. Такой список облегчает сверку следующей редакции исходника и защищает согласованные термины от случайной замены.