
TrulyFreeOCR
producthunt.com
商用级自包含OCR,支持MRC压缩
昨天制作者:Mark Front
关于 TrulyFreeOCR
TrulyFreeOCR 是一款自包含的 Java 命令行工具,能将扫描版 PDF 和图片转换为可搜索、高压缩的 PDF 文档。它采用 MRC 压缩 技术(PNG 背景 + JBIG2/G4 前景),在保持可读性的同时大幅减小文件体积。无需依赖 Ghostscript、Python 运行时或任何云 API,仅需一个 fat JAR 包和内置的 Tesseract 即可运行。项目采用 Apache 2.0 开源协议,可无忧用于商业场景。
核心功能
- OCR 识别:基于 Tesseract 引擎,支持多种语言,将扫描件中的文字识别为可搜索文本层。
- MRC 压缩:自动分离图像为背景层和前景层,分别采用 PNG 和 JBIG2/G4 编码,实现高压缩比。
- 自包含部署:单一 fat JAR 文件包含所有依赖,无需额外安装软件或配置环境。
- 批量处理:支持命令行批量转换,适合集成到自动化工作流中。
主要特性
- 零外部依赖:无需 Ghostscript、Python 或云服务,降低部署复杂度和成本。
- 商业友好授权:Apache 2.0 协议,可自由用于商业项目,无版权顾虑。
- 高效压缩:MRC 技术可减少 50%-80% 的文件大小,同时保持高质量。
- 跨平台:基于 Java,可在 Windows、macOS、Linux 上运行。
- 可搜索 PDF:生成 PDF 同时包含图像和可搜索文本层,方便检索。
适用场景
- 文档数字化:将纸质扫描件转换为可搜索的电子档案。
- 企业文档管理:在合规要求下压缩和 OCR 处理大量合同、发票。
- 开发者集成:通过命令行或 Java API 集成到现有系统。
- 个人使用:快速处理扫描书籍、笔记等。