🌐 Français

pdftoepub.co

N'emballe pas votre PDF sous forme d'images de pages — il reconstruit le texte depuis zéro pour produire un EPUB 3 réellement redistribuable, adapté à tous les écrans.

Publicité
Choisissez votre fichier PDF touchez ou glissez-déposez — jusqu'à 100 Mo

En cliquant sur Convertir, vous confirmez disposer du droit de traiter le fichier que vous téléversez.

Publicité

Pourquoi convertir un PDF numérisé en EPUB est-il difficile ?

Lorsqu'un document est numérisé, le PDF contient en réalité des images de pages. Le texte est produit ensuite par le logiciel d'OCR et déposé sur l'image comme une couche invisible. Cette couche ne dit ni où commence un paragraphe, ni quelle ligne est un titre, ni quel mot est en italique : elle ne conserve que des lignes indépendantes dont on connaît seulement la position sur la page.

Les convertisseurs ordinaires reprennent ces lignes telles quelles. Le résultat est un fichier où chaque ligne devient un paragraphe séparé, où les numéros de page s'invitent au milieu des phrases et où les mots restent coupés en deux. Cet outil, lui, reconstruit le texte depuis zéro.

Que se passe-t-il pendant la conversion ?

ProblèmeTraitement
Filigranes et en-têtes courantsLes lignes courtes qui se répètent sur la plupart des pages, le texte des marges et les polices différentes du corps sont supprimés
Mots coupés en fin de ligneLes traits d'union de césure sont retirés et les deux moitiés recollées
Limites de paragrapheL'alinéa est mesuré pour repérer le début d'un nouveau paragraphe ; un paragraphe à cheval sur deux pages n'est pas coupé
Erreurs de lettres de l'OCRCorrigées en prenant pour preuve le vocabulaire du document lui-même
SectionsDétectées grâce à l'espace laissé en tête de section ; la table des matières est construite automatiquement
Couverture et métadonnéesL'image de couverture ainsi que le titre et l'auteur sont extraits du PDF

Comment la correction OCR reste-t-elle sûre ?

Les logiciels de numérisation confondent les lettres : le w est souvent lu vv. Mais corriger à l'aveugle abîme de vrais mots — le mot turc « kuvvet » contient réellement vv. Cet outil ne corrige pas à l'aide d'un dictionnaire externe mais à partir du vocabulaire du document lui-même : si la graphie correcte apparaît déjà souvent dans ce document, il corrige ; sinon il laisse le mot intact. Chaque modification est listée sur l'écran de résultat, et vous pouvez désactiver entièrement la correction.

Questions fréquentes

Quelle est la différence entre un PDF numérisé et un PDF ordinaire ?

Dans un document numérisé, chaque page est une image ; le texte est produit par l'OCR et déposé de façon invisible par-dessus. Cette couche ne porte aucune information de structure : ni paragraphes, ni titres, ni italiques. Cet outil redéduit cette structure à partir de la mise en page.

Mes fichiers sont-ils conservés ?

Le PDF téléversé et l'EPUB produit sont conservés dans un stockage temporaire et supprimés automatiquement sous 24 heures. Les fichiers ne sont partagés avec aucun tiers.

Quelle taille de fichier est prise en charge ?

Les fichiers PDF jusqu'à 100 Mo. Un document classique de 300 pages est converti en quelques secondes.

Les PDF sans couche de texte peuvent-ils être convertis ?

Oui. Si vous téléversez un tel fichier, nous vous proposons de lancer la reconnaissance de texte directement sur cette page, sur votre propre ordinateur — le fichier n'est envoyé nulle part pour cela. Les données linguistiques sont téléchargées à la première utilisation et les documents longs peuvent prendre quelques minutes.

Qui est responsable des fichiers que je téléverse ?

La responsabilité des fichiers téléversés et de la conversion incombe entièrement à l'utilisateur. Ne téléversez que des fichiers que vous avez le droit de traiter.

Publicité
Publicité
Publicité