Próximamente

Unlimited-OCR

Motor OCR de nueva generación de Baidu. Análisis de documentos one-shot long-horizon con ventana de contexto de 32K — imágenes, documentos multipágina y PDFs. Próximamente en PDF to MD.

Análisis one-shot32K contextoPDF & ImagenLicencia MITSGLang Serving
32.768 Tokens de contexto
300 DPI Precisión de renderizado PDF
2 modos Modos Gundam / Base
MIT Licencia open source

Qué es Unlimited-OCR

Unlimited-OCR es un sistema OCR open source de Baidu, posicionado como solución de análisis documental de nueva generación. Procesa documentos muy largos en una sola pasada — verdadero análisis one-shot long-horizon.

🎯 OCR de imagen única

Dos modos: Gundam (base_size=1024, con recorte) para layouts complejos, y Base (image_size=1024) para documentos estándar.

📄 Documentos multipágina

Entrada de múltiples imágenes en secuencia con análisis conjunto automático. Mecanismo anti-repetición evita salida redundante.

📑 Análisis PDF directo

Renderiza páginas PDF en imágenes 300 DPI mediante PyMuPDF para análisis multipágina. Sin preprocesamiento.

⚡ Inferencia de alto rendimiento

Dos backends: Hugging Face Transformers y SGLang. SGLang ofrece API compatible con OpenAI y FlashAttention 3.

🔧 Procesamiento por lotes

Script infer.py integrado que lanza automáticamente el servidor SGLang con peticiones concurrentes. Soporta directorios de imágenes o entrada PDF.

🏗️ Stack tecnológico

PyTorch con precisión bfloat16 en GPU NVIDIA. Requiere Python 3.12, CUDA 12.9, Transformers 4.57.1.

Próximamente en PDF to MD

Estamos integrando Unlimited-OCR en la plataforma PDF to MD, trayendo capacidades más potentes de análisis documental. Una vez integrado, podrás acceder a todas las funciones a través de nuestra API.

🌐 Experiencia online

Sube documentos directamente en el sitio PDF to MD y selecciona el motor Unlimited-OCR para experimentar el análisis one-shot de documentos largos.

🔌 API para desarrolladores

API RESTful próximamente — soporte para imagen única, multipágina y PDF con streaming, procesamiento por lotes y parámetros personalizados.

📊 Salida estructurada

Resultados del análisis directamente en Markdown, preservando tablas, listas y jerarquías de títulos para integración con LLM.

🛡️ Estable y fiable

Basado en el framework de inferencia SGLang con auto-escalado y recuperación de fallos para servicio OCR de nivel empresarial.

Cómo funciona

Desde la subida del documento hasta la salida estructurada — completamente automatizado.

01 Subir PDF / Imagen
02 Análisis Unlimited-OCR
03 Markdown estructurado
04 API / Descargar salida

Obtén acceso anticipado

La API de Unlimited-OCR se lanzará pronto. Si deseas acceso anticipado, detalles de precios o colaboración técnica, contáctanos.