
촌키
Chonkie
웹 정보와 내부 문서를 자동 분석해 핵심 인사이트와 시각화된 데이터를 제공하는 딥 리서치 플랫폼
무료 + 유료WebDesktop오픈소스LLM 기반
웹사이트 방문하기chonkie.ai
OpenEvidence와(과) 비교하기촌키 대안 모아보기소개
Chonkie는 심층 리서치 에이전트나 리서치 오토파일럿 플랫폼이라기보다, RAG 애플리케이션을 위한 오픈 소스 데이터 수집·전처리 라이브러리입니다. 문서와 텍스트를 AI가 검색하기 좋은 단위로 나누는 작업을 중심으로 하며, 필요에 따라 데이터 가져오기, 정제, 임베딩, 벡터 데이터베이스 저장까지 이어지는 파이프라인을 구성할 수 있습니다. 파이썬과 자바스크립트에서 사용할 수 있고, 언어에 종속되지 않은 REST API 서버로도 실행할 수 있어 애플리케이션이나 사내 시스템에 연결하기 쉽습니다. API 서버는 자체 인프라에서 운영하는 방식으로 제공되므로 민감한 문서를 외부 서비스로 보내지 않고 처리하려는 개발팀에 적합합니다. 여러 청킹 전략을 동일한 인터페이스로 다룰 수 있다는 점이 일반적인 단일 텍스트 분할 도구와의 차이이며, 의미 기반 분할이나 코드 구조를 고려한 분할처럼 검색 품질을 높이기 위한 선택지도 제공합니다. 반면 공식 문서에서 주제별 웹 모니터링, 내부 문서와 공개 웹 데이터의 결합, 출처가 포함된 후속 질문 답변, 이메일·슬랙 알림, SOC 2·HIPAA 준수, 표와 문서의 자동 그래프 시각화 기능은 확인되지 않습니다. 따라서 현재 확인 가능한 Chonkie는 리서치 결과를 직접 제공하는 사용자용 서비스보다, 개발자가 자체 RAG 검색·생성 시스템의 데이터 처리 계층을 구축할 때 활용하는 도구로 보는 것이 정확합니다.
활용 워크플로우
데이터 인입 및 소스 모니터링
데이터 인입 및 소스 모니터링웹 공개 소스 실시간 크롤링기업 내부 보안 문서 통합 (PDF, Docs)시장 이슈 및 특정 토픽 모니터링 설정
Chonkie 지능형 프로세싱
Chonkie 지능형 프로세싱시맨틱 기반 스마트 청킹 (Semantic Chunking)내부 지식과 웹 맥락의 유기적 결합다중 에이전트 기반 심층 분석 (Deep Research)
데이터 추출 및 구조화
데이터 추출 및 구조화비정형 텍스트 내 수치 데이터 식별표(Table) 데이터 자동 추출 및 정제검증된 출처(Citations) 매핑
시각화 및 엔터프라이즈 배포
시각화 및 엔터프라이즈 배포데이터 시각화 그래프 자동 생성SOC 2/HIPAA 준수 보안 리포팅협업 도구(Slack, 이메일) 알림 송출
핵심 차별점: 방대한 내부 문서와 실시간 웹 데이터를 결합하여 텍스트 속 숨은 수치를 자동으로 시각화하고 보안 인프라 내에서 연구를 수행함.
주요 기능
- 토큰·문장·재귀·시맨틱·코드·LLM 기반 등 7가지 이상의 청킹 방식 지원
- 토큰 청킹 기준 기존 대비 최대 33배 빠른 처리 속도
- HTML 테이블 구조 보존 청킹(TableChunker) 지원
- 56개 언어 다국어 청킹 지원
- 32개 이상의 벡터DB·AI 프레임워크 통합
- 자체 호스팅 FastAPI 기반 REST API 서버 제공
장점 & 단점
웹검색을 통해 수집된 사용자 피드백 정보입니다
장점
- 가장 큰 장점은 검색의 깊이입니다. 일반 AI가 상위 몇 개의 결과만 요약한다면, Chonkie는 수백 개의 웹 소스를 스스로 뒤져 사람이 놓치기 쉬운 세부 정보를 찾아냅니다. 특히 문서 내의 숫자 데이터를 파싱하여 별도의 작업 없이 시각화 차트로 만들어주는 기능은 리서치 업무 시간을 수 시간에서 수 분으로 단축해줍니다. 또한, 출처가 명확히 기재되어 팩트 체크가 용이하며, 사용자의 내부 지식 베이스와 연결할 수 있어 단순한 정보 전달을 넘어 실무에 바로 적용 가능한 인사이트를 도출해낸다는 전문가들의 긍정적인 평가가 많습니다.
- Token Chunking이 최대 33배 빠른 처리 속도 제공
- 기본 설치 21MB로 LangChain/LlamaIndex(80-171MB) 대비 가벼움
- 기본 기능에 외부 의존성 없이 독립 실행 가능
- 32개 이상 벡터 DB 및 임베딩 모델 통합 지원
- 56개 언어 기본 지원으로 다국어 환경 대응
- SDPM, Late Chunking 등 독특한 청킹 전략 내장
단점
- 심층 분석(Deep Research)을 수행하는 특성상 질문 하나에 대한 답변을 얻기까지 수분 이상의 대기 시간이 발생하여, 빠른 질답을 원하는 사용자에게는 답답하게 느껴질 수 있습니다. 또한, 영문 소스 탐색 능력이 압도적으로 설계되어 있어 한국어 로컬 정보나 비영어권 데이터의 분석 깊이는 영어에 비해 상대적으로 얕을 수 있다는 점이 한계로 지적됩니다. 구독형 서비스로서 고도화된 리서치 유닛을 사용할 때 발생하는 비용이 개인 사용자보다는 기업이나 전문 리서처에게 더 적합한 가격 체계를 가지고 있다는 점도 고려해야 할 요소입니다.
- 벤치마크 수치가 경쟁사 대비 '콜드' 실행 비교로 과장 의심
- 내장 Ollama 프로바이더 미지원으로 별도 연동 작업 필요
- HTML 파싱용 사전 정의 규칙 미포함 (추후 지원 예정)
- 원격 API 호출 시 비동기 인터페이스 미지원으로 성능 제한
- GitHub 저장소가 법적/IP 문제로 일시 비공개된 이력 존재
- 임베딩 레지스트리가 신규 프로바이더 추가 시 중앙 수정 필요한 구조
가격 정보
무료 + 유료시작 가격: Open source (free)
오픈 소스 기반의 RAG(검색 증강 생성) 청킹 라이브러리로, 누구나 무료로 다운로드하여 사용할 수 있다. 별도의 유료 구독 없이 GitHub를 통해 소스 코드가 제공되며, 상업적 프로젝트에도 자유롭게 통합이 가능하다.
정보 확인일: · 가격은 공식 페이지에서 재확인하세요
활용 사례
- RAG 파이프라인의 문서 전처리 및 청킹
- 대규모 코드베이스 시맨틱 검색 인덱싱
- 다국어 문서의 고속 텍스트 분할 처리
- 벡터 데이터베이스 임베딩 전 데이터 준비
대상 사용자
AI/ML 개발자RAG 파이프라인 엔지니어백엔드 개발자데이터 엔지니어
태그
문서 작성개발자 도구
검증 근거
회사·가격·기능 정보는 아래 원문과 최근 검증 기록을 기준으로 표시합니다. 서로 다른 출처가 충돌하면 공식 원문과 최신 검증값을 우선합니다.
최근 검증 2026. 09. 02.검증 출처 4개
최근 소식
확인된 변경 내역
- 2026-07-07 Chonkie v1.7.0 이 출시되어 LiteParse 통합, ComponentRegistry 공개, 문서 전면 개편이 반영되었습니다.
- 2026-05-13 v1.6.6 에서 CodeChunker 인덱싱 속도가 44.5% 개선되었고, 2026-05-19 v1.6.7 은 MistralOCR 이미지 텍스트 추출을 지원합니다.
- 운영사가 Feyn Labs 로 리브랜딩되어 www.chonkie.ai 는 으로 302 리다이렉트되며 GitHub 조직도 feyninc 로 이관되었습니다. 다만 오픈소스 라이브러리 Chonkie 와 문서 https://docs.chonkie.ai 는 기존 브랜드로 계속 유지되고 있습니다. /
사용자 리뷰
리뷰를 불러오는 중...
대안 도구
이 도구 대신 사용할 수 있는 대안



