OCR PDF
您可直接在浏览器中使用此工具,并通过本地 WebAssembly 处理 - - 除非您明确选择会将提取文本发送至我们 API 的 AI 功能,否则文件始终留在您的设备上。JoyPDF 为核心 PDF 任务提供免费套餐,并提供可选 Premium 方案,以解锁更高限额与 AI 工作流。
指南与常见问题
OCR PDF
从扫描件提取可搜索文本。
关于此工具
将扫描的 PDF 和纯图像文档转换为可搜索、易于复制的文件 - 使用 Tesseract.js 识别浏览器内的文本,无需将页面上传到云 OCR 场。选择语言,在本地运行识别,然后下载带有与可见扫描对齐的隐藏文本层的PDF。免费,无需帐户。对于存档合同、政府表格和研究 PDF 至关重要,您需要 Ctrl+F、复制粘贴或稍后的 PDF 到-Word 传递。
What you get
- 输出:PDF,每个页面上都有一个不可见的文本层 - 在 Acrobat、Preview 和浏览器中搜索和复制作品。
- 引擎:Tesseract LSTM 通过 WebAssembly 在本地运行 - 默认情况下没有第三方 OCR API。
- 语言:多语言包结合 + - 准确性取决于每个脚本的训练数据。
- 视觉效果:页面外观保持扫描; OCR 不会自动重新排版或清除倾斜的边距。
- 手写:草书和签名通常会失败,或者部分打印效果最好。
- 限制:在旧笔记本电脑上进行 300 dpi 的大型扫描需要花费一些时间;非常微弱的文本或严重的噪音会降低准确性。
适用场景
- 使旧纸质档案可搜索,无需将卷发送给外部OCR供应商。
- 当原生数字文本不可用时,准备从 PDF 到 Word 的扫描合同。
- 启用从技术上来说是图像的政府PDF的复制粘贴。
- 对从打印输出扫描的会议数据包进行索引以获取内部知识库。
Why JoyPDF for this
云OCR服务上传每个页面 - 包括签名、帐号和分类段落 - 以远程识别文本。 JoyPDF OCR 完全在浏览器中运行:像素和识别的字符串在处理过程中保留在设备上。您可以明确选择语言,而不是服务器猜测。这符合 GDPR、法律特权以及禁止出站文档传输的气隙相邻工作流程。
使用方法
- 1添加您的扫描版PDF拖放该文件或从您的设备中选择它。页面在本地加载 - 没有服务器端 OCR 队列。
- 2选择OCR语言选择识别语言 - 例如英语、波兰语或组合 eng+pol 用于双语扫描。
- 3运行识别JoyPDF 处理您设备上的每个页面;每页显示进度,因为 OCR 是 CPU 密集型的。
- 4下载可搜索的PDF保存OCR的文件 - 视觉上与扫描相似,但下面有可选择、可搜索的文本。
100% 浏览器内
文件留在设备上
符合 GDPR