Estrae il testo contenuto in un PDF in una casella che puoi copiare o salvare come file .txt. Legge i caratteri realmente incorporati nel documento, quindi un PDF scansionato o composto solo da immagini non produce nulla: non c'è OCR. Il file viene letto nel browser e non viene mai caricato.
Che cos'è l'estrazione di testo da un PDF?
È il processo di ricavare i caratteri contenuti in un PDF e trasformarli in testo normale, modificabile, ricercabile e copiabile. È utile per riportare o citare il contenuto del documento altrove, oppure quando vuoi conservare il contenuto in formato TXT o cercarlo.
Come estrarre il testo da un PDF
- Seleziona il file — trascina il PDF da cui estrarre il testo oppure clicca per aprirlo.
- Estrai il testo — premi «Estrai testo» e i caratteri di ogni pagina appariranno qui sotto.
- Copia o salva — usa «Copia» per gli appunti oppure «Salva TXT» per scaricare un file.
Si può estrarre testo anche da un PDF scansionato?
No. Se le pagine sono solo immagini, come nelle scansioni o nelle foto, non ci sono informazioni testuali da ricavare. In questi casi serve un OCR che riconosca i caratteri nell'immagine, mentre questo strumento legge solo il livello di testo effettivamente presente nel documento.
Posso salvare il testo estratto?
Sì. Il testo estratto viene mostrato subito sullo schermo e puoi copiarlo negli appunti con il pulsante Copia oppure scaricarlo come file di testo (.txt) con il pulsante Salva TXT. Puoi anche selezionare e copiare solo la parte che ti serve.
Le tabelle e le colonne restano invariate?
I caratteri vengono estratti fedelmente, ma tabelle, colonne multiple e impaginazioni complesse potrebbero non essere riprodotte esattamente com'erano. Tienilo presente: dopo l'estrazione potresti dover sistemare un po' l'ordine o le interruzioni di riga.
I file vengono caricati su un server?
No. L'estrazione del testo avviene interamente all'interno del browser, quindi il PDF non viene inviato né memorizzato su alcun server. Puoi elaborare in tutta tranquillità anche documenti sensibili. La libreria di elaborazione viene scaricata una sola volta, alla prima estrazione, e in seguito rimane in cache.