SIE

에이전트가 부르는 모든 오픈 모델을 내 클러스터 한 곳에서 서빙하는 추론 엔진

pip install "sie-server[local]"

에이전트 작업 뒤에 깔리는 모델 호출을 API 하나로 모으는 오픈소스 추론 엔진입니다. 검색과 재순위, 문서를 마크다운으로 바꾸는 변환, 스키마를 지키는 구조화 출력, 콘텐츠 안전 판정, 에이전트 루프 자체까지 같은 서버가 처리합니다. 100개가 넘는 모델을 필요할 때 올리고 LRU 로 내리며, OpenAI 호환 엔드포인트라 기존 코드를 그대로 옮길 수 있습니다.

판단

이럴 때 씁니다

  • 작업마다 모델 서버를 따로 띄워 두었다가 관리 대상이 늘어난 상태를 정리하고 싶을 때
  • 임베딩과 재순위, OCR, 구조화 추출을 한 클러스터에서 같은 API 로 부르고 싶을 때
  • OpenAI 호환 엔드포인트를 유지한 채 모델만 내 인프라로 옮겨야 할 때
  • 게이트웨이와 오토스케일링, 대시보드, Terraform 까지 한 번에 딸려 오는 편이 나을 때

이럴 땐 쓰지 마세요

  • 모델 한 종류만 쓰고 앞으로도 늘릴 계획이 없을 때. 온디맨드 로딩과 LRU 축출이 값을 못 합니다
  • GPU 를 확보하지 못했고 생성 작업이 주력일 때
  • 익명 사용 데이터 수집이 정책상 허용되지 않는데 비활성화 설정을 관리할 수 없을 때
  • Kubernetes 를 운영하지 않으면서 프로덕션 스택 전체를 원할 때

차별점

  • 작업별로 서버를 나누는 대신 검색, 문서 변환, 구조화 출력, 안전 판정, 에이전트 루프를 한 시스템이 맡습니다.
  • 100개가 넘는 모델을 동시에 서빙하면서 온디맨드 로딩과 LRU 축출로 메모리를 돌려 씁니다.
  • 서버만이 아니라 로드밸런싱 게이트웨이, KEDA 오토스케일링, Grafana 대시보드, GKE·EKS·AKS Terraform 모듈까지 같은 Apache-2.0 으로 나옵니다.
  • LangChain, LlamaIndex, Haystack, DSPy, CrewAI 와 Chroma, Qdrant, Weaviate, LanceDB 통합을 파이썬과 타입스크립트 양쪽으로 제공합니다.

워크플로

  1. 01로컬이면 sie-server 를 설치해 띄우고, 리눅스 GPU 나 CPU 면 목적에 맞는 도커 이미지를 고릅니다.
  2. 02/readyz 가 ok 를 돌려주는지 확인합니다.
  3. 03SDK 를 설치합니다. 파이썬과 타입스크립트 양쪽을 제공합니다.
  4. 04encode, score, extract 로 임베딩과 재순위와 개체 추출을 부릅니다. 모델의 첫 호출에서 가중치를 내려받고 이후 호출은 건너뜁니다.
  5. 05생성 작업이 필요하면 sglang 이미지로 바꿔 같은 포트에 다시 띄웁니다.
  6. 06프로덕션은 Helm 차트로 클러스터를 올리고 클라우드에 맞는 values 오버레이를 지정합니다.

주요 명령

명령설명
pip install "sie-server[local]" && sie-server servemacOS 애플 실리콘이나 리눅스에서 네이티브로 띄웁니다. 파이썬 3.12 가 필요합니다.
docker run --gpus all -p 8080:8080 -v sie-hf-cache:/app/.cache/huggingface ghcr.io/superlinked/sie-server:latest-cuda12-default리눅스 NVIDIA GPU 용 기본 번들 이미지입니다.
pip install sie-sdk파이썬 SDK 입니다. 타입스크립트는 npm install @superlinked/sie-sdk 를 씁니다.
helm upgrade --install sie-cluster oci://ghcr.io/superlinked/charts/sie-cluster --namespace sie --create-namespace게이트웨이와 KEDA 오토스케일링까지 포함한 프로덕션 클러스터를 올립니다.

함정

설치 전에 확인하세요

  • 도커 이미지가 번들별로 나뉩니다. LightOnOCR 과 GLM-OCR 은 transformers5 이미지에서만 제공되고 default 이미지는 의도적으로 광고하지 않습니다.
  • 생성 작업은 별도 이미지입니다. 먼저 띄운 서버를 내리고 sglang 이미지를 같은 포트에 다시 올려야 합니다.
  • 익명 사용 데이터 수집이 기본으로 켜져 있습니다. SIE_TELEMETRY_DISABLED=1 이나 DO_NOT_TRACK=1 으로 끕니다.
  • 모델마다 첫 호출에서 가중치를 내려받습니다. 진행 상황은 서버 터미널에만 나오므로 첫 호출이 느린 것을 장애로 오인하기 쉽습니다.
  • 네이티브 설치는 파이썬 3.12 를 요구하고, audio-prep 멤버는 별도의 네이티브 빌드 선행 조건을 요구합니다.

검토 메모

공식 문서·릴리스·공개 자료를 바탕으로 정리한 편집 메모입니다.

저는 이 프로젝트의 값어치가 모델 성능이 아니라 경계를 어디에 그었는지에 있다고 봅니다. 에이전트를 만들다 보면 임베딩 서버, 재순위 서버, OCR 서버, 안전 판정 서버가 각각 다른 이유로 하나씩 늘어납니다. SIE 는 그 목록을 작업 다섯 종류로 정리하고 전부 한 API 뒤에 넣었습니다. 운영 대상이 줄어드는 방향이라 저는 이 정리를 지지합니다.

도입을 검토한다면 먼저 재 볼 것은 모델 수입니다. 온디맨드 로딩과 LRU 축출은 여러 모델을 번갈아 쓸 때 값을 하는 장치라, 모델 한 종류만 쓴다면 이 구조는 얻는 것 없이 복잡도만 늘립니다. 반대로 이미 서버를 서너 개 띄워 두고 있다면 정리 효과가 바로 보일 것입니다.

운영 관점에서 두 가지를 미리 정하고 들어가시길 권합니다. 하나는 텔레메트리입니다. 익명 수집이 기본으로 켜져 있어 사내 정책에 따라 먼저 꺼야 할 수 있습니다. 다른 하나는 이미지 선택입니다. 번들이 나뉘어 있어서 쓰려는 OCR 모델이 기본 이미지에 없을 수 있고, 생성 작업은 아예 서버를 내렸다가 다시 올려야 합니다. 이 두 가지는 문서를 안 읽으면 반드시 한 번 부딪히는 지점입니다.

덧붙이면 이 프로젝트가 서버만 내놓지 않았다는 점을 저는 높게 봅니다. 로드밸런싱 게이트웨이와 오토스케일링, 대시보드, 그리고 세 클라우드용 Terraform 모듈까지 같은 Apache-2.0 으로 함께 공개했습니다. 자체 호스팅 추론을 검토하다 보면 모델을 띄우는 일보다 그 앞뒤를 짜는 일이 더 오래 걸리는데, 그 부분을 참고 구현으로라도 받아 갈 수 있다는 뜻입니다. 전부 그대로 쓸 필요는 없고 우리 환경에 맞는 조각만 골라 봐도 값이 있습니다.

비교

vLLM 이나 TGI 가 생성 모델 서빙 하나를 깊게 판다면, SIE 는 에이전트가 실제로 부르는 호출의 종류 전체를 한 클러스터로 모으는 쪽입니다. 임베딩과 OCR 과 재순위가 각각 다른 서버에 흩어져 있던 구성을 정리하는 데 값이 있고, 단일 모델만 쓴다면 이 구조는 과합니다.

최근 변경

v0.7.2에서는 Qwen3.8 27B 생성 프로필을 추가하고 speculative streaming을 안정화했으며, SGLang 커널 캐시를 유지해 추론 성능을 높였습니다. 스토리지에는 Alibaba OSS 페이로드 저장과 ACK/RRSA용 Helm 지원을 추가하고, KEDA scale-to-zero와 ACK 스토리지 선택 로직을 견고하게 다듬었습니다.