即将上线

Unlimited-OCR

百度开源下一代 OCR 引擎,32K 上下文窗口单次长文档解析——覆盖单图、多页、PDF 全场景。即将接入 PDF to MD 平台。

单次解析32K 上下文PDF & 图片MIT 协议SGLang 推理
32,768 Token 上下文长度
300 DPI PDF 渲染精度
2 种模式 Gundam / Base 模式
MIT 开源协议

什么是 Unlimited-OCR

Unlimited-OCR 是百度推出的开源 OCR 系统,定位为超越 DeepSeek-OCR 的下一代文档解析方案。它能够在单次推理中处理超长文档,无需分段或多次调用,实现真正的单次长文档解析。

🎯 单图识别

两种处理模式:Gundam 模式(base_size=1024,启用裁剪)适合复杂版面,Base 模式(image_size=1024)适合标准文档,灵活适配不同场景。

📄 多页文档

支持多图序列输入,自动进行多页联合解析。搭配反重复机制,有效避免重复输出。

📑 PDF 直接解析

通过 PyMuPDF 将 PDF 页面渲染为 300 DPI 图像后进行多页解析,无需预处理,直接从 PDF 到结构化文本。

⚡ 高性能推理

支持 Hugging Face Transformers 和 SGLang 双推理后端。SGLang 提供 OpenAI 兼容 API 和 FlashAttention 3 加速。

🔧 批量处理

内置 infer.py 脚本,自动启动 SGLang 服务器并发送并发请求,支持图片目录或 PDF 文件输入,可配置并发数。

🏗️ 技术栈

基于 PyTorch + bfloat16 精度,运行于 NVIDIA GPU。要求 Python 3.12、CUDA 12.9、Transformers 4.57.1。

即将接入 PDF to MD

我们正在将 Unlimited-OCR 集成到 PDF to MD 平台,为用户提供更强大的文档解析能力。集成完成后,您将可以通过我们的 API 直接调用全部功能。

🌐 在线体验

无需部署,直接在 PDF to MD 网站上传文档,选择 Unlimited-OCR 引擎,即可体验单次长文档解析能力。

🔌 开发者 API

即将开放 RESTful API,支持单图、多页、PDF 全场景调用,提供流式响应、批量处理、自定义参数等企业级功能。

📊 结构化输出

解析结果直接输出 Markdown 格式,保留表格、列表、标题层级等结构信息,无缝对接 LLM 工作流。

🛡️ 稳定可靠

基于 SGLang 高性能推理框架,支持自动扩缩容和故障恢复,为企业级应用提供稳定的 OCR 服务保障。

工作流程

从文档上传到结构化输出,全程自动化处理。

01 上传 PDF / 图片
02 Unlimited-OCR 解析
03 结构化 Markdown
04 API / 下载输出

获取 Early Access

Unlimited-OCR API 即将上线。如果您希望第一时间获取访问权限、了解定价方案或有技术合作意向,请通过以下方式联系我们。