Извлекает текст, хранящийся внутри PDF, в поле, которое можно скопировать или сохранить как файл .txt. Читаются символы, реально встроенные в документ, поэтому отсканированный или состоящий только из картинок PDF не даст ничего — распознавания текста здесь нет. Файл читается в браузере и никуда не отправляется.
Что такое извлечение текста из PDF?
Это извлечение символов, содержащихся в PDF, и преобразование их в обычный текст, который можно редактировать, искать и копировать. Полезно, когда нужно перенести или процитировать содержимое документа, либо сохранить его в TXT или выполнить поиск по нему.
Как извлечь текст из PDF
- Выберите файл — перетащите PDF, из которого нужно извлечь текст, или откройте его по клику.
- Извлеките текст — нажмите «Извлечь текст», и содержимое каждой страницы появится ниже.
- Скопируйте или сохраните — нажмите «Копировать», чтобы поместить текст в буфер обмена, или «Сохранить TXT», чтобы скачать файл.
Извлекается ли текст из сканированного PDF?
Нет. Если страница представляет собой только изображение — скан или фотографию, — в ней нет текстовой информации для извлечения. В этом случае нужен OCR, распознающий символы на изображении, а этот инструмент читает только текстовый слой, реально содержащийся в документе.
Можно ли сохранить извлечённый текст?
Да. Извлечённый текст сразу отображается на экране; кнопкой Копировать его можно поместить в буфер обмена, а кнопкой Сохранить TXT — скачать как текстовый файл (.txt). Можно скопировать и только нужную часть.
Сохраняются ли таблицы и колонки?
Сами символы извлекаются точно, но таблицы, несколько колонок и сложная вёрстка могут не воспроизвестись в исходном виде. После извлечения, возможно, придётся немного поправить порядок или переносы строк.
Загружаются ли файлы на сервер?
Нет. Извлечение текста выполняется полностью в браузере, поэтому PDF не передаётся и не сохраняется на сервере. Даже конфиденциальные документы можно обрабатывать спокойно. Библиотека обработки загружается только один раз при первом извлечении, а затем кешируется.