目录
Zerox OCR 是由Omni-AI团队开发的一款开源AI工具。它并非传统的OCR软件,而是利用大语言视觉模型(如GPT-4o-mini)来“阅读”文档页面,并直接生成结构化的Markdown内容。核心流程是先将PDF等文件转换为图像,再交给视觉模型进行识别与转换,最终输出便于编辑和集成的Markdown文档。这种创新的方法使在处理复杂排版、表格甚至手写体时,准确率优于许多传统方案。
官网入口地址
下载地址
-
Python包安装:使用
pip install py-zerox命令安装 -
Node.js安装:使用
npm install zerox命令安装
功能介绍
Zerox OCR 的功能围绕高效、精准的文档智能化处理展开:
-
零样本OCR识别:基于GPT-4o-mini视觉模型,无需针对特定文档类型进行预先训练,即可直接识别各种格式的文档,包括扫描件、排版复杂的报告等。
-
Markdown格式输出:识别结果以结构化的Markdown格式呈现,保留了文档的层级结构(如标题、列表、表格),极大方便了后续的编辑、分析和导入他系统。
-
复杂文档处理:能有效处理包含表格、图表、多栏排版甚至手写体内容的复杂文档,准确提取关键信息。
-
多模型与多格式支持:除GPT-4o-mini外,还支持通过配置调用Azure OpenAI、Anthropic Claude、Google Gemini等多种模型。支持PDF、DOCX、图片等30多种文件格式。
-
灵活部署与API集成:支持本地运行,保障数据隐私安全。同时提供Node.js和Python的SDK及API接口,便于开发者集成到现有应用或自动化工作流中。
应用场景
-
企业文档自动化:自动处理大量的发票、合同、内部报告,快速提取关键字段并录入系统。
-
学术与科研:将纸质论文、技术文档转换为可编辑、可搜索的电子格式,便于文献管理和信息抽取。
-
法律与金融:对法律卷宗、财务报表等复杂文件进行数字化和结构化处理,提高审查效率。
-
内容创作与出版:将旧有印刷资料或图片格式的内容快速转换为Markdown等通用格式,用于网站发布或电子书制作。
使用方法
Zerox OCR 主要通过代码调用使用,以下是Python环境的基本流程:
-
安装依赖:
-
在系统上安装
poppler-utils(用于PDF转图像)。 -
执行
pip install py-zerox安装Python包。
-
-
设置模型与密钥:在代码中配置想要使用的视觉模型(如
gpt-4o-mini)和对应的API密钥。 -
编写调用代码:
-
导入
zerox模块。 -
调用
zerox()函数,传入文件路径(支持本地或URL)、模型名称等参数。
-
-
运行与获取结果:运行脚本,程序会自动完成文件转换、图像识别和Markdown生成。最终结果可以在代码中直接使用,或保存到指定的输出目录。
服务支持
Zerox OCR 是一个开源项目,核心服务通过调用用户自备的AI模型API来实现。费用主要取决于所选用模型的API调用成本。根据公开数据,使用 gpt-4o-mini 处理1000页文档的成本约为4美元,在同类服务中具有较高性价比。
| 源码反馈/咨询 (共有 条反馈) |
Zerox OCR常见问题
Zerox OCR是由Omni-AI团队开发并维护的开源项目,并非一家公司。该团队在GitHub上公开了项目的全部源代码,并持续进行更新。
Zerox OCR是一个基于大语言模型(比如GPT-4o-mini)的智能文档识别工具。它的核心作用就是把PDF、图片或者Word文档里的内容“读”出来,然后转化成结构清晰的Markdown格式,方便你二次编辑、搜索或导入到他系统里。
主要通过代码来调用。你可以用 pip install py-zerox 安装Python包,或者用 npm install zerox 安装Node.js包。然后在你的代码里设置好AI模型的API密钥,调用相关函数并传入文档路径,程序就会自动处理并输出Markdown结果了。
工具本身作为开源软件是免费的,你可以自由下载、使用和修改代码。但是,运行它需要调用GPT-4o-mini这类付费AI模型的API,这部分费用是由你直接支付给模型提供方的。处理1000页文档的成本大约在4美元左右。
数据安全方面,Zerox OCR支持在本地运行,你的文档不需要上传到任何第三方服务器,隐私性很好。使用方便程度上,它主要面向开发者,需要具备一定的编程基础来配置和调用,对于普通用户来说,学习门槛会比在线工具高一些。
特色是“零样本识别”和“理解”文档结构。传统OCR像一个“文字搬运工”,只负责把图片上的字抠出来,不关心排版;而Zerox OCR像一个“智能编辑”,它能“看懂”文档的表格、标题层级,然后直接输出结构化的Markdown,在处理复杂文档时效果特别明显。
官网地址是 https://getomni.ai/ocr 开源项目的所有代码和文档都在GitHub上:https://github.com/getomni-ai/zerox
有的。在调用Zerox函数时,你可以设置 concurrency 参数来控制同时处理的页面数量,默认是10。如果只需要处理部分页面,可以用 select_pages 参数指定页码,避免处理整个文档,这两个技巧都能显著提升处理速度。
支持。Zerox OCR的设计很灵活,它可以对接多种主流的视觉模型。除了OpenAI的GPT系列,你也可以通过简单的配置,切换使用Google的Gemini、Anthropic的Claude,或者AWS Bedrock等平台提供的模型。
支持常见的PDF文档、DOCX文档以及各种图片格式(如JPG、PNG等)。主流办公和存档用的文件格式基本都涵盖,超过30种。
这个是因为系统环境缺少必要的转换工具。使用Node.js版本需要提前安装 graphicsmagick 和 ghostscript;使用Python版本则需要安装 poppler-utils。请根据你的操作系统和版本,搜索对应的安装方法即可。
Zerox OCR会尽力保留原始结构,但AI的理解偶尔出现偏差。建议检查你的文档图片质量是否清晰,并尝试调整调用参数,比如使用 maintain_format 参数来更好地保持格式连贯性。