Demnächst

Unlimited-OCR

Nächste-Generation-OCR-Engine von Baidu. One-shot Long-horizon-Dokumentenanalyse mit 32K-Kontextfenster — für Einzelbilder, mehrseitige Dokumente und PDFs. Bald auf PDF to MD.

One-shot-Analyse32K KontextPDF & BildMIT-LizenzSGLang Serving
32.768 Token-Kontextlänge
300 DPI PDF-Rendergenauigkeit
2 Modi Gundam- / Base-Modus
MIT Open-Source-Lizenz

Was ist Unlimited-OCR

Unlimited-OCR ist ein Open-Source-OCR-System von Baidu, das als Dokumentenanalyse der nächsten Generation positioniert ist. Es verarbeitet sehr lange Dokumente in einem einzigen Durchlauf — echte One-shot Long-horizon-Analyse.

🎯 Einzelbild-OCR

Zwei Verarbeitungsmodi: Gundam (base_size=1024, mit Zuschneiden) für komplexe Layouts und Base (image_size=1024) für Standarddokumente.

📄 Mehrseitige Dokumente

Unterstützt Eingabe mehrerer Bilder in Folge mit automatischer mehrseitiger Analyse. Anti-Repeat-Mechanismus vermeidet redundante Ausgabe.

📑 Direkte PDF-Analyse

Rendert PDF-Seiten über PyMuPDF in 300-DPI-Bilder für mehrseitige Analyse. Keine Vorverarbeitung nötig.

⚡ Hochleistungs-Inferenz

Zwei Backends: Hugging Face Transformers und SGLang. SGLang bietet OpenAI-kompatible API mit FlashAttention 3.

🔧 Stapelverarbeitung

Integriertes infer.py-Skript startet automatisch den SGLang-Server mit parallelen Anfragen. Unterstützt Bildverzeichnisse oder PDF-Eingabe.

🏗️ Technologie-Stack

PyTorch mit bfloat16-Genauigkeit auf NVIDIA GPU. Erfordert Python 3.12, CUDA 12.9, Transformers 4.57.1.

Bald auf PDF to MD

Wir integrieren Unlimited-OCR in die PDF-to-MD-Plattform und bringen leistungsfähigere Dokumentenanalyse. Nach der Integration können Sie alle Funktionen über unsere API nutzen.

🌐 Online-Erfahrung

Laden Sie Dokumente direkt auf der PDF-to-MD-Website hoch und wählen Sie die Unlimited-OCR-Engine für One-shot-Analyse langer Dokumente.

🔌 Developer-API

RESTful-API kommt bald — unterstützt Einzelbild-, Mehrseiten- und PDF-Aufrufe mit Streaming, Stapelverarbeitung und benutzerdefinierten Parametern.

📊 Strukturierte Ausgabe

Analyseergebnisse direkt als Markdown mit Tabellen, Listen und Überschriftenhierarchien für nahtlose LLM-Integration.

🛡️ Stabil und zuverlässig

Auf dem SGLang-Hochleistungs-Inferenz-Framework mit Auto-Scaling und Fehlerwiederherstellung für OCR auf Unternehmensebene.

So funktioniert es

Vom Dokumenten-Upload zur strukturierten Ausgabe — vollständig automatisiert.

01 PDF / Bild hochladen
02 Unlimited-OCR-Analyse
03 Strukturiertes Markdown
04 API / Ausgabe herunterladen

Early Access erhalten

Die Unlimited-OCR-API startet bald. Für vorzeitigen Zugang, Preisdetails oder technische Zusammenarbeit kontaktieren Sie uns bitte.