🌐 Русский

pdftoepub.co

Не заворачивает PDF в виде изображений страниц — заново собирает текст и создаёт по-настоящему перетекающий EPUB 3, подходящий для любого экрана.

Реклама
Выберите файл PDF нажмите или перетащите файл — до 100 МБ

Нажимая «Конвертировать», вы подтверждаете, что имеете право обрабатывать загружаемый файл.

Реклама

Почему отсканированный PDF трудно превратить в EPUB?

Когда документ сканируют, внутри PDF на самом деле лежат изображения страниц. Текст создаётся позже программой OCR и накладывается поверх изображения невидимым слоем. В этом слое не записано, где начинается абзац, какая строка является заголовком и какое слово набрано курсивом, — там только отдельные строки, о которых известно лишь их положение на странице.

Обычные конвертеры берут эти строки как есть. В результате получается файл, где каждая строка становится отдельным абзацем, номера страниц попадают в середину предложений, а слова остаются разорванными надвое. Этот инструмент вместо этого собирает текст заново.

Что происходит во время конвертации?

ПроблемаЧто делается
Водяные знаки и колонтитулыУбираются короткие строки, повторяющиеся на большинстве страниц, текст на полях и шрифты, отличные от основного
Слова, разорванные переносомЗнаки переноса удаляются, а половины слова соединяются
Границы абзацевИзмеряется отступ первой строки, чтобы найти начало нового абзаца; абзац, переходящий на следующую страницу, не разрывается
Ошибки букв после OCRИсправляются с опорой на словарь самого документа
РазделыОпределяются по отступу, который оставляют в начале раздела; оглавление строится автоматически
Обложка и метаданныеИзображение обложки и сведения о названии и авторе извлекаются из PDF

Почему исправление OCR безопасно?

Программы распознавания путают буквы: w часто читается как vv. Но исправлять вслепую — значит портить настоящие слова: в турецком слове «kuvvet» действительно есть vv. Этот инструмент исправляет не по внешнему словарю, а по словарю самого документа: если правильное написание уже часто встречается в этом же документе, исправление выполняется, иначе слово остаётся нетронутым. Каждое изменение перечисляется на экране результата, а исправление можно полностью отключить.

Частые вопросы

Чем отсканированный PDF отличается от обычного?

В отсканированном документе каждая страница — это изображение; текст создаётся программой OCR и незаметно накладывается сверху. Такой слой не несёт никаких сведений о структуре: ни абзацев, ни заголовков, ни курсива. Этот инструмент заново выводит структуру из вёрстки страницы.

Хранятся ли мои файлы?

Загруженный PDF и созданный EPUB лежат во временном хранилище и удаляются автоматически в течение 24 часов. Файлы не передаются третьим лицам.

Какой размер файла поддерживается?

Файлы PDF до 100 МБ. Обычный документ на 300 страниц конвертируется за несколько секунд.

Можно ли конвертировать PDF без текстового слоя?

Да. Если вы загрузите такой файл, мы предложим выполнить распознавание прямо на этой странице, на вашем компьютере — файл для этого никуда не отправляется. При первом использовании загружаются языковые данные, а длинные документы могут занять несколько минут.

Кто отвечает за загружаемые файлы?

Ответственность за загруженные файлы и за конвертацию полностью лежит на пользователе. Загружайте только те файлы, которые вы вправе обрабатывать.

Реклама
Реклама
Реклама