🎯 단일 이미지 OCR
두 가지 처리 모드: 복잡한 레이아웃용 Gundam 모드(base_size=1024, 크롭 활성화)와 표준 문서용 Base 모드(image_size=1024).
곧 출시
바이두의 차세대 OCR 엔진. 32K 컨텍스트 윈도우로 원샷 장문서 파싱 — 단일 이미지, 다중 페이지, PDF 지원. 곧 PDF to MD에서 만나보세요.
Unlimited-OCR은 바이두가 개발한 오픈소스 OCR 시스템입니다. 매우 긴 문서를 한 번의 추론으로 처리하여 진정한 원샷 장문서 파싱을 실현합니다.
두 가지 처리 모드: 복잡한 레이아웃용 Gundam 모드(base_size=1024, 크롭 활성화)와 표준 문서용 Base 모드(image_size=1024).
다중 이미지 시퀀스 입력을 지원하고 자동으로 다중 페이지 결합 분석을 수행합니다. 반복 방지 메커니즘으로 중복 출력을 회피합니다.
PyMuPDF를 통해 PDF 페이지를 300 DPI 이미지로 렌더링하여 다중 페이지 분석을 수행합니다. 전처리가 불필요합니다.
Hugging Face Transformers와 SGLang 두 가지 백엔드. SGLang은 OpenAI 호환 API와 FlashAttention 3를 제공합니다.
infer.py 스크립트가 SGLang 서버를 자동 시작하여 병렬 요청을 전송합니다. 이미지 디렉토리 또는 PDF 입력을 지원합니다.
NVIDIA GPU에서 bfloat16 정밀도의 PyTorch. Python 3.12, CUDA 12.9, Transformers 4.57.1 필요.
Unlimited-OCR을 PDF to MD 플랫폼에 통합하여 더 강력한 문서 파싱 기능을 제공합니다. 통합 후 API를 통해 모든 기능에 접근할 수 있습니다.
PDF to MD 사이트에서 문서를 직접 업로드하고 Unlimited-OCR 엔진을 선택하여 원샷 장문서 파싱을 체험하세요.
RESTful API가 곧 출시 — 단일 이미지, 다중 페이지, PDF 호출을 지원하며 스트리밍, 배치 처리, 사용자 정의 매개변수를 제공합니다.
파싱 결과를 직접 Markdown으로 출력. 테이블, 리스트, 제목 계층을 유지하여 LLM 워크플로에 원활하게 통합됩니다.
SGLang 고성능 추론 프레임워크 기반의 자동 스케일링과 장애 복구로 엔터프라이즈급 OCR 서비스를 제공합니다.
문서 업로드부터 구조화된 출력까지 — 완전 자동화.
Unlimited-OCR API가 곧 출시됩니다. 조기 접근, 가격 정보 또는 기술 협업을 원하시면 연락해 주세요.