🎯 单图识别
两种处理模式:Gundam 模式(base_size=1024,启用裁剪)适合复杂版面,Base 模式(image_size=1024)适合标准文档,灵活适配不同场景。
Unlimited-OCR 是百度推出的开源 OCR 系统,定位为超越 DeepSeek-OCR 的下一代文档解析方案。它能够在单次推理中处理超长文档,无需分段或多次调用,实现真正的单次长文档解析。
两种处理模式:Gundam 模式(base_size=1024,启用裁剪)适合复杂版面,Base 模式(image_size=1024)适合标准文档,灵活适配不同场景。
支持多图序列输入,自动进行多页联合解析。搭配反重复机制,有效避免重复输出。
通过 PyMuPDF 将 PDF 页面渲染为 300 DPI 图像后进行多页解析,无需预处理,直接从 PDF 到结构化文本。
支持 Hugging Face Transformers 和 SGLang 双推理后端。SGLang 提供 OpenAI 兼容 API 和 FlashAttention 3 加速。
内置 infer.py 脚本,自动启动 SGLang 服务器并发送并发请求,支持图片目录或 PDF 文件输入,可配置并发数。
基于 PyTorch + bfloat16 精度,运行于 NVIDIA GPU。要求 Python 3.12、CUDA 12.9、Transformers 4.57.1。
我们正在将 Unlimited-OCR 集成到 PDF to MD 平台,为用户提供更强大的文档解析能力。集成完成后,您将可以通过我们的 API 直接调用全部功能。
无需部署,直接在 PDF to MD 网站上传文档,选择 Unlimited-OCR 引擎,即可体验单次长文档解析能力。
即将开放 RESTful API,支持单图、多页、PDF 全场景调用,提供流式响应、批量处理、自定义参数等企业级功能。
解析结果直接输出 Markdown 格式,保留表格、列表、标题层级等结构信息,无缝对接 LLM 工作流。
基于 SGLang 高性能推理框架,支持自动扩缩容和故障恢复,为企业级应用提供稳定的 OCR 服务保障。
从文档上传到结构化输出,全程自动化处理。
Unlimited-OCR API 即将上线。如果您希望第一时间获取访问权限、了解定价方案或有技术合作意向,请通过以下方式联系我们。