Perché convertire un PDF scansionato in EPUB è difficile?
Quando un documento viene scansionato, il PDF contiene in realtà immagini delle pagine. Il testo viene prodotto in seguito dal software OCR e steso sopra l'immagine come un livello invisibile. Quel livello non dice dove comincia un paragrafo, quale riga è un titolo o quale parola è in corsivo: conserva soltanto righe indipendenti di cui si conosce la posizione sulla pagina.
I convertitori comuni prendono quelle righe così come sono. Il risultato è un file in cui ogni riga diventa un paragrafo a sé, i numeri di pagina finiscono in mezzo alle frasi e le parole restano spezzate in due. Questo strumento invece ricostruisce il testo da zero.
Che cosa succede durante la conversione?
| Problema | Che cosa viene fatto |
|---|---|
| Filigrane e testatine | Vengono rimosse le righe brevi che si ripetono nella maggior parte delle pagine, il testo nei margini e i caratteri diversi da quelli del corpo |
| Parole spezzate a fine riga | I trattini di sillabazione vengono tolti e le due metà ricongiunte |
| Confini dei paragrafi | Si misura il rientro per individuare l'inizio di un nuovo paragrafo; un paragrafo a cavallo di due pagine non viene spezzato |
| Errori di lettere dell'OCR | Corretti usando come prova il vocabolario del documento stesso |
| Sezioni | Rilevate dallo spazio lasciato all'inizio di ogni sezione; l'indice viene costruito automaticamente |
| Copertina e metadati | L'immagine di copertina e i dati di titolo/autore vengono estratti dal PDF |
Come si mantiene sicura la correzione OCR?
I software di scansione confondono le lettere: la w viene spesso letta come vv. Ma correggere alla cieca rovina parole reali: la parola turca «kuvvet» contiene davvero vv. Questo strumento non corregge con un dizionario esterno, ma con il vocabolario del documento stesso: se la grafia corretta compare già di frequente nello stesso documento allora corregge, altrimenti lascia la parola intatta. Ogni modifica è elencata nella schermata dei risultati e la correzione può essere disattivata del tutto.
Domande frequenti
Qual è la differenza tra un PDF scansionato e uno normale?
In un documento scansionato ogni pagina è un'immagine; il testo è prodotto dall'OCR e collocato in modo invisibile sopra di essa. Quel livello non contiene alcuna informazione di struttura: né paragrafi, né titoli, né corsivi. Questo strumento ricava di nuovo la struttura dall'impaginazione.
I miei file vengono conservati?
Il PDF caricato e l'EPUB prodotto restano in archiviazione temporanea e vengono eliminati automaticamente entro 24 ore. I file non sono condivisi con terze parti.
Fino a che dimensione di file si può arrivare?
File PDF fino a 100 MB. Un documento tipico di 300 pagine si converte in pochi secondi.
Si possono convertire i PDF senza livello di testo?
Sì. Se carichi un file di questo tipo, ti proponiamo di eseguire il riconoscimento del testo direttamente in questa pagina, sul tuo computer: il file non viene inviato da nessuna parte. I dati della lingua vengono scaricati al primo utilizzo e i documenti lunghi possono richiedere qualche minuto.
Chi è responsabile dei file che carico?
La responsabilità dei file caricati e della conversione è interamente dell'utente. Carica soltanto file che hai il diritto di trattare.