
Docling
PDF 및 다양한 문서를 마크다운·JSON으로 변환하는 IBM의 경량 오픈소스 라이브러리
무료Python LibraryCLIDocker오픈소스
웹사이트 방문하기docling-project.github.io
jcode와(과) 비교하기Docling 대안 모아보기소개
활용 워크플로우
입력
로컬 및 클라우드 소스 문서 (PDF, DOCX, PPTX, HTML)스캔된 이미지 파일 (PNG, JPEG, TIFF)웹 URL 및 온라인 문서 저장소복잡한 표와 수식이 포함된 학술 논문 및 기술 명세서
Docling
AI 모델 기반 레이아웃 분할 및 시각적 요소 탐지TableFormer 엔진을 활용한 표 구조 및 셀 논리 복원통합 OCR (EasyOCR/Tesseract) 기반 텍스트 추출문서 계층 구조(제목, 하위 절, 메타데이터) 식별 및 트리 구성
출력
LLM 최적화 Markdown 데이터구조화된 계층형 JSON/JSONLLangChain/LlamaIndex 연동 Document 객체추출된 시각적 요소(그림, 차트) 이미지 파일
RAG 파이프라인 자동화
데이터 엔지니어가 LangChain 통합 기능을 사용하여 파싱된 데이터를 벡터 데이터베이스에 실시간으로 인덱싱
대규모 아카이브 구조화
스타트업 CTO가 CPU 최적화 로컬 모델을 활용하여 보안이 중요한 대량의 내부 문서를 오프라인에서 마이그레이션
사용자 정의 모델 튜닝
데이터 과학자가 특정 도메인 문서에 맞춰 OCR 엔진 스택이나 레이아웃 예측 임계값을 조정
핵심 차별점: IBM의 TableFormer 모델을 통해 복잡하게 병합된 표의 논리적 구조를 로컬 CPU 환경에서도 완벽하게 복원하는 기술적 우위
주요 기능
장점 & 단점
웹검색을 통해 수집된 사용자 피드백 정보입니다
장점
- 무료로 사용 가능하며 로컬에서 실행되므로 데이터 보안이 우수합니다. 설치가 간편하고 처리 속도가 매우 빠르며, 복잡한 표 인식 능력이 뛰어납니다.
단점
- 매우 복잡한 시각적 요소가 포함된 문서의 경우 상용 멀티모달 API 기반 서비스보다 인식률이 다소 낮을 수 있습니다.
가격 정보
무료시작 가격: 무료
IBM에서 개발한 오픈소스 문서 파싱 도구로, Apache-2.0 라이선스에 따라 누구나 무료로 사용할 수 있습니다. 별도의 유료 구독 모델은 없으며, 로컬 환경이나 자체 서버에 설치하여 PDF, DOCX 등 다양한 문서를 마크다운이나 JSON 형식으로 변환할 수 있습니다.
정보 확인일:
활용 사례
- 로컬 환경에서의 RAG 데이터 파이프라인 구축
- 대규모 문서 아카이브의 텍스트 구조화 및 색인
- 민감한 문서의 오프라인 파싱 및 처리
- LLM 학습용 고품질 텍스트 데이터 추출
대상 사용자
AI·ML 개발자데이터 엔지니어RAG 파이프라인 구축자프라이버시 중시 기업
연동 서비스
LangChainLlamaIndexHugging FacePydantic
태그
오픈소스문서변환IBM마크다운데이터추출
최근 소식
확인된 변경 내역
- 2026-06-12 Docling v2.102.1이 출시되어 서비스 모듈의 image_export_mode 기본값 버그가 수정되고, 사전 서명된 아티팩트를 통한 변환 결과 조회 기능이 추가되었습니다.
- 2026-06-09 Docling v2.100.0이 출시되어 DocLang 백엔드와 EPUB 문서 변환을 전면 지원하는 EPUB 백엔드가 도입되었습니다.
- 2026-05-19 docling-core v2.77.0 릴리스. | 2026-04-24 docling-serve v1.17.0 릴리스. 소스: https://pypi.org/project/docling-serve/ | docling-mcp v2.0 출시 — 하이브리드 아키텍처로 90% 용량 절감. 소스: https://pypi.org/project/docling-mcp/
사용자 리뷰
리뷰를 불러오는 중...
대안 도구
이 도구 대신 사용할 수 있는 대안



