Em breve

Unlimited-OCR

Motor OCR de nova geração da Baidu. Análise de documentos one-shot long-horizon com janela de contexto de 32K — imagens, documentos multipáginas e PDFs. Em breve no PDF to MD.

Análise one-shot32K contextoPDF & ImagemLicença MITSGLang Serving
32.768 Tokens de contexto
300 DPI Precisão de renderização PDF
2 modos Modos Gundam / Base
MIT Licença open source

O que é Unlimited-OCR

Unlimited-OCR é um sistema OCR open source da Baidu, posicionado como solução de análise documental de nova geração. Processa documentos muito longos em uma única passagem — verdadeira análise one-shot long-horizon.

🎯 OCR de imagem única

Dois modos: Gundam (base_size=1024, com recorte) para layouts complexos, e Base (image_size=1024) para documentos padrão.

📄 Documentos multipáginas

Entrada de múltiplas imagens em sequência com análise conjunta automática. Mecanismo anti-repetição evita saída redundante.

📑 Análise PDF direta

Renderiza páginas do PDF em imagens 300 DPI via PyMuPDF para análise multipáginas. Sem pré-processamento.

⚡ Inferência de alto desempenho

Dois backends: Hugging Face Transformers e SGLang. SGLang oferece API compatível com OpenAI e FlashAttention 3.

🔧 Processamento em lote

Script infer.py integrado que inicia automaticamente o servidor SGLang com requisições concorrentes. Suporta diretórios de imagens ou entrada PDF.

🏗️ Stack tecnológico

PyTorch com precisão bfloat16 em GPU NVIDIA. Requer Python 3.12, CUDA 12.9, Transformers 4.57.1.

Em breve no PDF to MD

Estamos integrando o Unlimited-OCR à plataforma PDF to MD, trazendo capacidades mais poderosas de análise documental. Após a integração, você poderá acessar todos os recursos pela nossa API.

🌐 Experiência online

Envie documentos diretamente no site PDF to MD e selecione o motor Unlimited-OCR para análise one-shot de documentos longos.

🔌 API para desenvolvedores

API RESTful em breve — suporte a imagem única, multipáginas e PDF com streaming, processamento em lote e parâmetros personalizados.

📊 Saída estruturada

Resultados da análise diretamente em Markdown, preservando tabelas, listas e hierarquias de títulos para integração com LLM.

🛡️ Estável e confiável

Baseado no framework SGLang com auto-scaling e recuperação de falhas para serviço OCR de nível empresarial.

Como funciona

Do upload do documento à saída estruturada — totalmente automatizado.

01 Enviar PDF / Imagem
02 Análise Unlimited-OCR
03 Markdown estruturado
04 API / Baixar saída

Obtenha acesso antecipado

A API Unlimited-OCR será lançada em breve. Para acesso antecipado, detalhes de preços ou colaboração técnica, entre em contato.