Crawl4AI

LLM 입력용 마크다운을 뽑는 웹 크롤러

pip install -U crawl4ai

웹 페이지를 RAG 와 에이전트가 바로 쓸 수 있는 마크다운으로 바꾸는 오픈소스 크롤러입니다. 파이썬 라이브러리로 쓰거나 도커 서버로 띄웁니다. 최근 릴리스가 연달아 보안 수정에 집중돼 v0.9.0 부터 도커 API 서버가 기본 인증 적용에 루프백 바인딩으로 바뀌었으니, 구버전을 쓰고 있다면 올리는 편이 낫습니다.

판단

이럴 때 씁니다

  • RAG 파이프라인에 넣을 문서를 웹에서 대량으로 모을 때
  • 페이지를 LLM 이 읽기 좋은 마크다운으로 정리해야 할 때
  • 크롤링 속도와 동시성을 코드에서 직접 제어하고 싶을 때
  • 자바스크립트로 그려지는 페이지를 다뤄야 할 때

이럴 땐 쓰지 마세요

  • 에이전트가 대화 중에 몇 페이지만 찾아보면 될 때는 MCP 서버가 맞습니다
  • 브라우저 바이너리를 설치할 수 없는 환경일 때
  • robots 정책상 크롤링이 허용되지 않는 대상일 때

차별점

  • 결과물이 LLM 입력을 전제로 한 마크다운입니다.
  • 라이브러리와 도커 서버 두 형태로 씁니다.
  • 추출 전략과 청킹을 코드에서 세밀하게 조정합니다.
  • 보안 이슈를 공개 권고 절차로 처리하고 릴리스 노트에 명시합니다.

워크플로

  1. 01pip install -U crawl4ai 로 설치하고 Playwright 브라우저를 준비합니다.
  2. 02단일 URL 로 먼저 돌려 마크다운 출력 형태를 확인합니다.
  3. 03추출 전략과 청킹을 조정해 후속 처리에 맞춥니다.
  4. 04대량 작업은 도커 서버로 띄워 API 로 호출합니다.
  5. 05운영에서는 인증을 켜고 토큰을 발급해 접근을 제한합니다.

주요 명령

명령설명
pip install -U crawl4ai라이브러리를 설치합니다.
pip install -e ".[all]"선택 기능까지 모두 포함해 소스에서 설치합니다.
docker run -d -p 11235:11235 --name crawl4ai --shm-size=1g unclecode/crawl4ai:latest도커 서버로 띄웁니다.

함정

설치 전에 확인하세요

  • 최근 릴리스가 연달아 보안 수정입니다. v0.9.3 에서 임의 파일 쓰기·SSRF·서비스 거부와 XSS 두 건을 닫았고, v0.8.7 도 도커 API 의 RCE·인증 우회 등을 고쳤습니다. 구버전을 쓰고 있다면 올려야 합니다.
  • v0.9.0 부터 도커 API 서버가 기본 인증 적용에 루프백 바인딩으로 바뀌었습니다. 예전처럼 열려 있다고 가정하면 안 됩니다.
  • 요청 본문이 신뢰할 수 없는 경계로 재정의됐습니다.
  • Playwright 브라우저가 필요해 컨테이너 이미지가 큽니다.

비교

Firecrawl MCP 는 에이전트가 대화 중에 호출하는 도구이고, 이쪽은 파이프라인에서 돌리는 라이브러리입니다. 수천 페이지를 일정 규칙으로 긁어 색인해야 하면 이쪽이고, 필요할 때 몇 페이지를 찾아보게 하려면 MCP 쪽이 맞습니다.

최근 변경

2026-08-31 v0.9.3 은 보안 릴리스입니다. PDF 처리 경로의 임의 파일 쓰기와 SSRF, 서비스 거부를 포함한 다섯 건의 권고를 닫고 도커 플레이그라운드의 XSS 두 건도 함께 고쳤습니다. 신규 기능 없이 버그 수정 33건이 들어갔습니다.