곧 출시

Unlimited-OCR

바이두의 차세대 OCR 엔진. 32K 컨텍스트 윈도우로 원샷 장문서 파싱 — 단일 이미지, 다중 페이지, PDF 지원. 곧 PDF to MD에서 만나보세요.

원샷 파싱32K 컨텍스트PDF & 이미지MIT 라이선스SGLang Serving
32,768 토큰 컨텍스트 길이
300 DPI PDF 렌더링 정밀도
2 모드 Gundam / Base 모드
MIT 오픈소스 라이선스

Unlimited-OCR이란

Unlimited-OCR은 바이두가 개발한 오픈소스 OCR 시스템입니다. 매우 긴 문서를 한 번의 추론으로 처리하여 진정한 원샷 장문서 파싱을 실현합니다.

🎯 단일 이미지 OCR

두 가지 처리 모드: 복잡한 레이아웃용 Gundam 모드(base_size=1024, 크롭 활성화)와 표준 문서용 Base 모드(image_size=1024).

📄 다중 페이지 문서

다중 이미지 시퀀스 입력을 지원하고 자동으로 다중 페이지 결합 분석을 수행합니다. 반복 방지 메커니즘으로 중복 출력을 회피합니다.

📑 PDF 직접 파싱

PyMuPDF를 통해 PDF 페이지를 300 DPI 이미지로 렌더링하여 다중 페이지 분석을 수행합니다. 전처리가 불필요합니다.

⚡ 고성능 추론

Hugging Face Transformers와 SGLang 두 가지 백엔드. SGLang은 OpenAI 호환 API와 FlashAttention 3를 제공합니다.

🔧 배치 처리

infer.py 스크립트가 SGLang 서버를 자동 시작하여 병렬 요청을 전송합니다. 이미지 디렉토리 또는 PDF 입력을 지원합니다.

🏗️ 기술 스택

NVIDIA GPU에서 bfloat16 정밀도의 PyTorch. Python 3.12, CUDA 12.9, Transformers 4.57.1 필요.

PDF to MD에 곧 출시

Unlimited-OCR을 PDF to MD 플랫폼에 통합하여 더 강력한 문서 파싱 기능을 제공합니다. 통합 후 API를 통해 모든 기능에 접근할 수 있습니다.

🌐 온라인 체험

PDF to MD 사이트에서 문서를 직접 업로드하고 Unlimited-OCR 엔진을 선택하여 원샷 장문서 파싱을 체험하세요.

🔌 개발자 API

RESTful API가 곧 출시 — 단일 이미지, 다중 페이지, PDF 호출을 지원하며 스트리밍, 배치 처리, 사용자 정의 매개변수를 제공합니다.

📊 구조화된 출력

파싱 결과를 직접 Markdown으로 출력. 테이블, 리스트, 제목 계층을 유지하여 LLM 워크플로에 원활하게 통합됩니다.

🛡️ 안정적이고 신뢰할 수 있는

SGLang 고성능 추론 프레임워크 기반의 자동 스케일링과 장애 복구로 엔터프라이즈급 OCR 서비스를 제공합니다.

작동 방식

문서 업로드부터 구조화된 출력까지 — 완전 자동화.

01 PDF / 이미지 업로드
02 Unlimited-OCR 파싱
03 구조화된 Markdown
04 API / 출력 다운로드

얼리 액세스 받기

Unlimited-OCR API가 곧 출시됩니다. 조기 접근, 가격 정보 또는 기술 협업을 원하시면 연락해 주세요.