Pourquoi convertir un PDF numérisé en EPUB est-il difficile ?
Lorsqu'un document est numérisé, le PDF contient en réalité des images de pages. Le texte est produit ensuite par le logiciel d'OCR et déposé sur l'image comme une couche invisible. Cette couche ne dit ni où commence un paragraphe, ni quelle ligne est un titre, ni quel mot est en italique : elle ne conserve que des lignes indépendantes dont on connaît seulement la position sur la page.
Les convertisseurs ordinaires reprennent ces lignes telles quelles. Le résultat est un fichier où chaque ligne devient un paragraphe séparé, où les numéros de page s'invitent au milieu des phrases et où les mots restent coupés en deux. Cet outil, lui, reconstruit le texte depuis zéro.
Que se passe-t-il pendant la conversion ?
| Problème | Traitement |
|---|---|
| Filigranes et en-têtes courants | Les lignes courtes qui se répètent sur la plupart des pages, le texte des marges et les polices différentes du corps sont supprimés |
| Mots coupés en fin de ligne | Les traits d'union de césure sont retirés et les deux moitiés recollées |
| Limites de paragraphe | L'alinéa est mesuré pour repérer le début d'un nouveau paragraphe ; un paragraphe à cheval sur deux pages n'est pas coupé |
| Erreurs de lettres de l'OCR | Corrigées en prenant pour preuve le vocabulaire du document lui-même |
| Sections | Détectées grâce à l'espace laissé en tête de section ; la table des matières est construite automatiquement |
| Couverture et métadonnées | L'image de couverture ainsi que le titre et l'auteur sont extraits du PDF |
Comment la correction OCR reste-t-elle sûre ?
Les logiciels de numérisation confondent les lettres : le w est souvent lu vv. Mais corriger à l'aveugle abîme de vrais mots — le mot turc « kuvvet » contient réellement vv. Cet outil ne corrige pas à l'aide d'un dictionnaire externe mais à partir du vocabulaire du document lui-même : si la graphie correcte apparaît déjà souvent dans ce document, il corrige ; sinon il laisse le mot intact. Chaque modification est listée sur l'écran de résultat, et vous pouvez désactiver entièrement la correction.
Questions fréquentes
Quelle est la différence entre un PDF numérisé et un PDF ordinaire ?
Dans un document numérisé, chaque page est une image ; le texte est produit par l'OCR et déposé de façon invisible par-dessus. Cette couche ne porte aucune information de structure : ni paragraphes, ni titres, ni italiques. Cet outil redéduit cette structure à partir de la mise en page.
Mes fichiers sont-ils conservés ?
Le PDF téléversé et l'EPUB produit sont conservés dans un stockage temporaire et supprimés automatiquement sous 24 heures. Les fichiers ne sont partagés avec aucun tiers.
Quelle taille de fichier est prise en charge ?
Les fichiers PDF jusqu'à 100 Mo. Un document classique de 300 pages est converti en quelques secondes.
Les PDF sans couche de texte peuvent-ils être convertis ?
Oui. Si vous téléversez un tel fichier, nous vous proposons de lancer la reconnaissance de texte directement sur cette page, sur votre propre ordinateur — le fichier n'est envoyé nulle part pour cela. Les données linguistiques sont téléchargées à la première utilisation et les documents longs peuvent prendre quelques minutes.
Qui est responsable des fichiers que je téléverse ?
La responsabilité des fichiers téléversés et de la conversion incombe entièrement à l'utilisateur. Ne téléversez que des fichiers que vous avez le droit de traiter.