近日公開

Unlimited-OCR

百度の次世代 OCR エンジン。32K コンテキストウィンドウでワンショット長文書解析 — 単一画像、複数ページ、PDF に対応。近日 PDF to MD に登場。

ワンショット解析32K コンテキストPDF & 画像MIT ライセンスSGLang Serving
32,768 トークン コンテキスト長
300 DPI PDF 描画精度
2 モード Gundam / Base モード
MIT オープンソース ライセンス

Unlimited-OCR とは

Unlimited-OCR は百度が開発したオープンソース OCR システムです。非常に長いドキュメントを 1 回の推論で処理し、真のワンショット長文書解析を実現します。

🎯 単一画像 OCR

2 つの処理モード:複雑なレイアウト向けの Gundam モード(base_size=1024、クロップ有効)と標準ドキュメント向けの Base モード(image_size=1024)。

📄 複数ページ ドキュメント

複数画像のシーケンス入力に対応し、自動的に複数ページの結合解析を実行。リピート防止メカニズムで冗長な出力を回避。

📑 PDF 直接解析

PyMuPDF を使用して PDF ページを 300 DPI 画像にレンダリングし複数ページ解析。前処理は不要。

⚡ 高性能推論

Hugging Face Transformers と SGLang の 2 つのバックエンド。SGLang は OpenAI 互換 API と FlashAttention 3 を提供。

🔧 バッチ処理

infer.py スクリプトが SGLang サーバーを自動起動し並列リクエストを送信。画像ディレクトリまたは PDF 入力に対応。

🏗️ 技術スタック

NVIDIA GPU 上で bfloat16 精度の PyTorch。Python 3.12、CUDA 12.9、Transformers 4.57.1 が必要。

PDF to MD に登場

Unlimited-OCR を PDF to MD プラットフォームに統合し、より強力なドキュメント解析機能を提供します。統合後は API を通じてすべての機能にアクセスできます。

🌐 オンライン体験

PDF to MD サイトでドキュメントを直接アップロードし、Unlimited-OCR エンジンを選択してワンショット長文書解析を体験。

🔌 デベロッパー API

RESTful API が近日公開 — 単一画像、複数ページ、PDF の呼び出しに対応し、ストリーミング、バッチ処理、カスタムパラメータを提供。

📊 構造化出力

解析結果を直接 Markdown で出力。テーブル、リスト、見出し階層を保持し、LLM ワークフローにシームレスに統合。

🛡️ 安定性と信頼性

SGLang 高性能推論フレームワークに基づき、自動スケーリングと障害復旧でエンタープライズグレードの OCR サービスを提供。

使い方

ドキュメントのアップロードから構造化出力まで — 完全自動。

01 PDF / 画像をアップロード
02 Unlimited-OCR 解析
03 構造化 Markdown
04 API / 出力ダウンロード

アーリーアクセスを取得

Unlimited-OCR API が近日ローンチされます。早期アクセス、料金詳細、技術提携をご希望の方はお問い合わせください。