Marker
문서를 마크다운과 JSON 으로 바꾸는 변환 파이프라인
pip install marker-pdfPDF 와 이미지, PPTX, DOCX, XLSX, HTML, EPUB 을 마크다운과 JSON, 청크, HTML 로 바꿉니다. 표와 양식, 수식과 인라인 수학, 링크와 참고문헌, 코드 블록의 형식을 살리고 이미지는 따로 뽑아 저장하며 머리말과 꼬리말 같은 군더더기를 걷어 냅니다. GPU 없이 CPU 나 애플 실리콘에서도 돌고, 정확도를 더 올려야 하면 LLM 을 함께 붙이는 모드가 있습니다. 1403개 PDF 로 된 외부 벤치마크에서 균형 모드가 전체 76.0퍼센트, 디지털 원본 PDF 에서 83.5퍼센트를 냈습니다. 자체 형식 규칙과 후처리를 붙여 확장할 수 있습니다.
판단
이럴 때 씁니다
- PDF 를 LLM 이 읽을 마크다운으로 대량 변환해야 할 때
- 표와 수식이 섞인 논문이나 교재를 형식 그대로 살려야 할 때
- GPU 없이 CPU 만 있는 환경에서 문서를 처리해야 할 때
이럴 땐 쓰지 마세요
- 모델 가중치가 아파치 라이선스가 아니라 상업 사용에 조건이 붙습니다
- 텍스트 레이어가 이미 깨끗한 문서라면 가벼운 추출기로 충분합니다
- 실시간 응답이 필요한 경로에는 변환 시간이 부담입니다
차별점
- PDF 뿐 아니라 오피스 문서와 EPUB, HTML 까지 같은 파이프라인으로 다룹니다.
- 외부 벤치마크 1403개 문서에서 점수와 항목별 결과를 공개합니다.
- LLM 을 선택적으로 붙여 표 병합과 양식 값 추출 같은 어려운 부분만 보강합니다.
워크플로
- 01파이토치가 깔린 환경에 패키지를 설치합니다.
- 02변환할 문서를 넘겨 마크다운이나 JSON 으로 뽑습니다.
- 03정확도를 더 올려야 하면 LLM 사용 옵션을 켭니다.
- 04표가 페이지를 넘어가거나 양식 값을 뽑아야 할 때 이 옵션이 효과가 큽니다.
- 05필요하면 자체 형식 규칙을 붙여 후처리를 확장합니다.
주요 명령
| 명령 | 설명 |
|---|---|
pip install marker-pdf | 변환기를 설치합니다. |
marker_single /path/to/file.pdf | 문서 하나를 변환합니다. |
marker_single /path/to/file.pdf --use_llm | LLM 을 함께 붙여 정확도를 올립니다. |
함정
설치 전에 확인하세요
- 코드는 아파치 2.0 이지만 모델 가중치는 다른 라이선스입니다. 연구와 개인 용도, 자금이나 매출이 일정 규모 아래인 스타트업까지 무료이고 그 밖의 상업 사용은 별도 조건이 붙습니다.
- LLM 사용 옵션의 기본 모델이 외부 제공자입니다. 문서를 밖으로 내보내면 안 되는 환경이면 로컬 모델로 바꿔야 합니다.
- 파이토치가 필요하므로 설치 용량과 환경 구성 비용이 작지 않습니다.
비교
문서 변환 도구는 텍스트만 뽑거나 통째로 비전 모델에 넘기는 두 갈래로 나뉩니다. 이쪽은 레이아웃 모델과 텍스트 레이어를 먼저 쓰고 어려운 부분에만 LLM 을 붙여서 비용과 정확도를 조절합니다. 대신 모델 가중치 라이선스가 코드와 달라 상업 도입 전에 확인이 필요합니다.
최근 변경
2.0.0 은 속도와 전면적인 CPU 지원, 정확도를 목표로 다시 쓴 판입니다. 새 OCR 엔진과 2천만 파라미터짜리 빠른 레이아웃 모델, 세 배 빨라진 텍스트 추출기 세 가지를 바탕으로 합니다.