把扫描版 PDF 转成 EPUB 为什么这么难?
文档被扫描后,PDF 里其实是一页页的图像。文字是 OCR 软件事后生成的,以一层看不见的图层覆盖在图像之上。这一图层并不记录段落从哪里开始、哪一行是标题、哪个词是斜体,它只保存一条条彼此独立、仅知道自己落在页面何处的文本行。
普通转换器把这些行原样搬走。结果就是:每一行都成了独立段落,页码混进句子中间,单词被拦腰截断。本工具的做法不同——它从零重建正文。
转换过程中做了什么?
| 问题 | 处理方式 |
|---|---|
| 水印与页眉页脚 | 剔除在多数页面重复出现的短行、页边区域的文字,以及与正文不同的字体 |
| 行末被断开的单词 | 去掉连字符并把两半拼合还原 |
| 段落边界 | 测量首行缩进来判断新段落的起点;跨页的段落不会被切断 |
| OCR 字符错误 | 以文档自身的词汇作为依据进行修正 |
| 章节 | 依据排版时在章节开头留出的空白识别,并自动生成目录 |
| 封面与元数据 | 从 PDF 中提取封面图片以及标题、作者信息 |
OCR 修正如何做到安全?
扫描软件会混淆字母:w 常被识别成 vv。但盲目修正会破坏真实存在的词——例如土耳其语单词 “kuvvet” 本身就含有 vv。本工具不依赖外部词典,而是以文档自身的词汇为准:如果正确写法在同一份文档里已经频繁出现就修正,否则保持原样。每一处改动都会列在结果页上,你也可以完全关闭修正功能。
常见问题
扫描版 PDF 和普通 PDF 有什么区别?
扫描文档的每一页都是图像;文字由 OCR 生成并以不可见的方式叠放在图像之上。这一图层完全不含结构信息——没有段落、标题或斜体。本工具从页面版式中重新推导出结构。
我的文件会被保存吗?
上传的 PDF 和生成的 EPUB 存放在临时存储中,并在 24 小时内自动删除。文件不会与第三方共享。
支持多大的文件?
支持最大 100 MB 的 PDF 文件。一份约 300 页的文档通常几秒钟即可转换完成。
没有文本层的 PDF 能转换吗?
可以。上传这类文件时,我们会提示直接在本页、在您自己的电脑上运行文字识别——文件不会因此被发送到任何地方。首次使用会下载语言数据,较长的文档可能需要几分钟。
上传的文件由谁负责?
上传的文件及转换操作的责任完全由用户承担。请仅上传您有权处理的文件。