🌐 中文

pdftoepub.co

不会把 PDF 当作页面图片打包,而是从零重建正文,生成真正可重排、适配任何屏幕的 EPUB 3。

广告
选择您的 PDF 文件 点击或拖放 — 最大 100 MB

点击「开始转换」即表示您确认拥有处理所上传文件的权利。

广告

把扫描版 PDF 转成 EPUB 为什么这么难?

文档被扫描后,PDF 里其实是一页页的图像。文字是 OCR 软件事后生成的,以一层看不见的图层覆盖在图像之上。这一图层并不记录段落从哪里开始、哪一行是标题、哪个词是斜体,它只保存一条条彼此独立、仅知道自己落在页面何处的文本行。

普通转换器把这些行原样搬走。结果就是:每一行都成了独立段落,页码混进句子中间,单词被拦腰截断。本工具的做法不同——它从零重建正文

转换过程中做了什么?

问题处理方式
水印与页眉页脚剔除在多数页面重复出现的短行、页边区域的文字,以及与正文不同的字体
行末被断开的单词去掉连字符并把两半拼合还原
段落边界测量首行缩进来判断新段落的起点;跨页的段落不会被切断
OCR 字符错误以文档自身的词汇作为依据进行修正
章节依据排版时在章节开头留出的空白识别,并自动生成目录
封面与元数据从 PDF 中提取封面图片以及标题、作者信息

OCR 修正如何做到安全?

扫描软件会混淆字母:w 常被识别成 vv。但盲目修正会破坏真实存在的词——例如土耳其语单词 “kuvvet” 本身就含有 vv。本工具不依赖外部词典,而是以文档自身的词汇为准:如果正确写法在同一份文档里已经频繁出现就修正,否则保持原样。每一处改动都会列在结果页上,你也可以完全关闭修正功能。

常见问题

扫描版 PDF 和普通 PDF 有什么区别?

扫描文档的每一页都是图像;文字由 OCR 生成并以不可见的方式叠放在图像之上。这一图层完全不含结构信息——没有段落、标题或斜体。本工具从页面版式中重新推导出结构。

我的文件会被保存吗?

上传的 PDF 和生成的 EPUB 存放在临时存储中,并在 24 小时内自动删除。文件不会与第三方共享。

支持多大的文件?

支持最大 100 MB 的 PDF 文件。一份约 300 页的文档通常几秒钟即可转换完成。

没有文本层的 PDF 能转换吗?

可以。上传这类文件时,我们会提示直接在本页、在您自己的电脑上运行文字识别——文件不会因此被发送到任何地方。首次使用会下载语言数据,较长的文档可能需要几分钟。

上传的文件由谁负责?

上传的文件及转换操作的责任完全由用户承担。请仅上传您有权处理的文件。

广告
广告
广告