Bientôt disponible

Unlimited-OCR

Moteur OCR de nouvelle génération par Baidu. Analyse documentaire one-shot long-horizon avec une fenêtre de contexte de 32K — images, documents multipages et PDFs. Bientôt sur PDF to MD.

Analyse one-shot32K contextePDF & ImageLicence MITSGLang Serving
32 768 Tokens de contexte
300 DPI Précision de rendu PDF
2 modes Modes Gundam / Base
MIT Licence open source

Qu'est-ce qu'Unlimited-OCR

Unlimited-OCR est un système OCR open source de Baidu, positionné comme solution d'analyse documentaire de nouvelle génération. Il traite des documents très longs en une seule passe — véritable analyse one-shot long-horizon.

🎯 OCR image unique

Deux modes : Gundam (base_size=1024, avec recadrage) pour les mises en page complexes, et Base (image_size=1024) pour les documents standards.

📄 Documents multipages

Entrée multi-images en séquence avec analyse jointe automatique. Mécanisme anti-répétition pour éviter la redondance de l' sortie.

📑 Analyse PDF directe

Rend les pages PDF en images 300 DPI via PyMuPDF pour l'analyse multipages. Aucun prétraitement nécessaire.

⚡ Inférence haute performance

Deux backends : Hugging Face Transformers et SGLang. SGLang offre une API compatible OpenAI avec FlashAttention 3.

🔧 Traitement par lots

Script infer.py intégré qui lance automatiquement le serveur SGLang avec des requêtes concurrentes. Supporte les répertoires d'images ou l'entrée PDF.

🏗️ Stack technique

PyTorch avec précision bfloat16 sur GPU NVIDIA. Nécessite Python 3.12, CUDA 12.9, Transformers 4.57.1.

Bientôt sur PDF to MD

Nous intégrons Unlimited-OCR à la plateforme PDF to MD pour des capacités d'analyse documentaire plus puissantes. Une fois intégré, vous pourrez accéder à toutes les fonctionnalités via notre API.

🌐 Expérience en ligne

Téléchargez vos documents directement sur PDF to MD et sélectionnez le moteur Unlimited-OCR pour l'analyse one-shot de longs documents.

🔌 API développeur

API RESTful bientôt disponible — appels image, multipages et PDF avec streaming, traitement par lots et paramètres personnalisés.

📊 Sortie structurée

Résultats d'analyse directement en Markdown avec tableaux, listes et hiérarchies de titres pour une intégration LLM transparente.

🛡️ Stable et fiable

Basé sur le framework d'inférence SGLang avec mise à l'échelle automatique et reprise après panne pour un service OCR de niveau entreprise.

Comment ça marche

Du téléchargement du document à la sortie structurée — entièrement automatisé.

01 Télécharger PDF / Image
02 Analyse Unlimited-OCR
03 Markdown structuré
04 API / Télécharger la sortie

Obtenir un accès anticipé

L'API Unlimited-OCR sera bientôt lancée. Pour un accès anticipé, les détails tarifaires ou une collaboration technique, contactez-nous.