Extrae el texto guardado dentro de un PDF a un cuadro que puedes copiar o guardar como archivo .txt. Lee los caracteres realmente incrustados en el documento, así que un PDF escaneado o hecho solo de imágenes no dará nada: no hay OCR. El archivo se lee en tu navegador y nunca se sube.
¿Qué es extraer texto de un PDF?
Consiste en sacar las letras contenidas en un PDF y convertirlas en texto normal que se puede editar, buscar y copiar. Es útil para llevar el contenido del documento a otro sitio, citarlo, o cuando quieres conservarlo como TXT y poder buscarlo.
Cómo extraer texto de un PDF
- Añade el archivo — arrastra y suelta el PDF del que quieres sacar el texto o haz clic para abrirlo.
- Extrae el texto — pulsa «Extraer texto» y las letras de cada página aparecerán debajo.
- Copia o guarda — cópialo al portapapeles con «Copiar» o descárgalo como archivo con «Guardar TXT».
¿Sale texto también de un PDF escaneado?
No. Si las páginas son solo imágenes, como en un escaneo o una foto, no hay información de texto que extraer. En ese caso hace falta un OCR que reconozca las letras dentro de la imagen; esta herramienta solo lee la capa de texto realmente incluida en el documento.
¿Puedo guardar el texto extraído?
Sí. El texto extraído se muestra directamente en pantalla y puedes copiarlo al portapapeles con el botón Copiar o descargarlo como archivo de texto (.txt) con el botón Guardar TXT. También puedes copiar solo la parte que necesites.
¿Se conservan las tablas y las columnas?
Las letras se extraen con precisión, pero las tablas, las varias columnas y las composiciones complejas pueden no reproducirse tal cual eran. Ten en cuenta que después de extraer el texto quizá tengas que ajustar un poco el orden o los saltos de línea.
¿Se suben mis archivos a un servidor?
No. La extracción de texto se realiza por completo dentro de tu navegador, así que el PDF no se envía ni se guarda en ningún servidor. Puedes procesar con tranquilidad incluso documentos confidenciales. La librería de procesamiento se descarga una sola vez en la primera extracción y luego queda en caché.