🎯 Einzelbild-OCR
Zwei Verarbeitungsmodi: Gundam (base_size=1024, mit Zuschneiden) für komplexe Layouts und Base (image_size=1024) für Standarddokumente.
Demnächst
Nächste-Generation-OCR-Engine von Baidu. One-shot Long-horizon-Dokumentenanalyse mit 32K-Kontextfenster — für Einzelbilder, mehrseitige Dokumente und PDFs. Bald auf PDF to MD.
Unlimited-OCR ist ein Open-Source-OCR-System von Baidu, das als Dokumentenanalyse der nächsten Generation positioniert ist. Es verarbeitet sehr lange Dokumente in einem einzigen Durchlauf — echte One-shot Long-horizon-Analyse.
Zwei Verarbeitungsmodi: Gundam (base_size=1024, mit Zuschneiden) für komplexe Layouts und Base (image_size=1024) für Standarddokumente.
Unterstützt Eingabe mehrerer Bilder in Folge mit automatischer mehrseitiger Analyse. Anti-Repeat-Mechanismus vermeidet redundante Ausgabe.
Rendert PDF-Seiten über PyMuPDF in 300-DPI-Bilder für mehrseitige Analyse. Keine Vorverarbeitung nötig.
Zwei Backends: Hugging Face Transformers und SGLang. SGLang bietet OpenAI-kompatible API mit FlashAttention 3.
Integriertes infer.py-Skript startet automatisch den SGLang-Server mit parallelen Anfragen. Unterstützt Bildverzeichnisse oder PDF-Eingabe.
PyTorch mit bfloat16-Genauigkeit auf NVIDIA GPU. Erfordert Python 3.12, CUDA 12.9, Transformers 4.57.1.
Wir integrieren Unlimited-OCR in die PDF-to-MD-Plattform und bringen leistungsfähigere Dokumentenanalyse. Nach der Integration können Sie alle Funktionen über unsere API nutzen.
Laden Sie Dokumente direkt auf der PDF-to-MD-Website hoch und wählen Sie die Unlimited-OCR-Engine für One-shot-Analyse langer Dokumente.
RESTful-API kommt bald — unterstützt Einzelbild-, Mehrseiten- und PDF-Aufrufe mit Streaming, Stapelverarbeitung und benutzerdefinierten Parametern.
Analyseergebnisse direkt als Markdown mit Tabellen, Listen und Überschriftenhierarchien für nahtlose LLM-Integration.
Auf dem SGLang-Hochleistungs-Inferenz-Framework mit Auto-Scaling und Fehlerwiederherstellung für OCR auf Unternehmensebene.
Vom Dokumenten-Upload zur strukturierten Ausgabe — vollständig automatisiert.
Die Unlimited-OCR-API startet bald. Für vorzeitigen Zugang, Preisdetails oder technische Zusammenarbeit kontaktieren Sie uns bitte.