🎯 単一画像 OCR
2 つの処理モード:複雑なレイアウト向けの Gundam モード(base_size=1024、クロップ有効)と標準ドキュメント向けの Base モード(image_size=1024)。
近日公開
百度の次世代 OCR エンジン。32K コンテキストウィンドウでワンショット長文書解析 — 単一画像、複数ページ、PDF に対応。近日 PDF to MD に登場。
Unlimited-OCR は百度が開発したオープンソース OCR システムです。非常に長いドキュメントを 1 回の推論で処理し、真のワンショット長文書解析を実現します。
2 つの処理モード:複雑なレイアウト向けの Gundam モード(base_size=1024、クロップ有効)と標準ドキュメント向けの Base モード(image_size=1024)。
複数画像のシーケンス入力に対応し、自動的に複数ページの結合解析を実行。リピート防止メカニズムで冗長な出力を回避。
PyMuPDF を使用して PDF ページを 300 DPI 画像にレンダリングし複数ページ解析。前処理は不要。
Hugging Face Transformers と SGLang の 2 つのバックエンド。SGLang は OpenAI 互換 API と FlashAttention 3 を提供。
infer.py スクリプトが SGLang サーバーを自動起動し並列リクエストを送信。画像ディレクトリまたは PDF 入力に対応。
NVIDIA GPU 上で bfloat16 精度の PyTorch。Python 3.12、CUDA 12.9、Transformers 4.57.1 が必要。
Unlimited-OCR を PDF to MD プラットフォームに統合し、より強力なドキュメント解析機能を提供します。統合後は API を通じてすべての機能にアクセスできます。
PDF to MD サイトでドキュメントを直接アップロードし、Unlimited-OCR エンジンを選択してワンショット長文書解析を体験。
RESTful API が近日公開 — 単一画像、複数ページ、PDF の呼び出しに対応し、ストリーミング、バッチ処理、カスタムパラメータを提供。
解析結果を直接 Markdown で出力。テーブル、リスト、見出し階層を保持し、LLM ワークフローにシームレスに統合。
SGLang 高性能推論フレームワークに基づき、自動スケーリングと障害復旧でエンタープライズグレードの OCR サービスを提供。
ドキュメントのアップロードから構造化出力まで — 完全自動。
Unlimited-OCR API が近日ローンチされます。早期アクセス、料金詳細、技術提携をご希望の方はお問い合わせください。