Envoy AI Gateway
엔보이 게이트웨이 위에 세운 두 단계 모델 트래픽 관문
helm upgrade -i aieg oci://docker.io/envoyproxy/ai-gateway-helm --version v1.1.0 --namespace envoy-ai-gateway-system --create-namespace이미 검증된 게이트웨이 기술 위에 모델 트래픽 처리를 얹은 오픈소스 프로젝트입니다. 두 단계 구조를 씁니다. 첫 단계 게이트웨이가 인증과 상위 라우팅, 전역 속도 제한을 맡고 두 번째 단계가 자체 운영하는 모델 서빙 클러스터로 들어가는 트래픽을 세밀하게 제어합니다. 두 번째 단계에는 추론 최적화를 위한 엔드포인트 선택 기능이 붙습니다. 열여섯 곳이 넘는 제공자를 지원하고 쿠버네티스 환경을 전제로 설계됐습니다. 토큰 집계와 요청별 자격 증명, 스트림 유휴 시간 제한과 장애 전환 같은 운영 기능이 정식 판에 들어 있습니다.
판단
이럴 때 씁니다
- 이미 쿠버네티스와 엔보이를 쓰고 있을 때
- 인증과 속도 제한을 트래픽 계층에서 처리해야 할 때
- 자체 운영하는 모델 서빙 클러스터로 들어가는 트래픽을 다뤄야 할 때
이럴 땐 쓰지 마세요
- 쿠버네티스가 없으면 도입 비용이 큽니다
- 단순히 여러 제공자를 묶는 것이 목적이면 가벼운 게이트웨이가 낫습니다
- 두 단계 구조를 이해해야 설정이 맞습니다
차별점
- 검증된 게이트웨이 기술 위에 얹혀 트래픽 계층 기능을 그대로 씁니다.
- 인증과 전역 제한을 맡는 층과 모델 접근을 제어하는 층을 분리합니다.
- 추론 최적화를 위한 엔드포인트 선택을 지원합니다.
- 요청별 상류 자격 증명과 스트림 유휴 제한, 장애 전환을 정식 판에서 제공합니다.
워크플로
- 01기반 게이트웨이를 준비합니다.
- 02차트로 정의와 본체를 설치합니다.
- 03첫 단계에 인증과 상위 라우팅, 전역 속도 제한을 겁니다.
- 04두 번째 단계에서 모델 서빙 클러스터로 가는 경로를 세밀하게 정합니다.
- 05토큰 집계와 추적을 켜서 사용량을 봅니다.
주요 명령
| 명령 | 설명 |
|---|---|
helm upgrade -i aieg-crd oci://docker.io/envoyproxy/ai-gateway-crds-helm --namespace envoy-ai-gateway-system | 사용자 정의 자원 정의를 먼저 설치합니다. |
helm upgrade -i aieg oci://docker.io/envoyproxy/ai-gateway-helm --namespace envoy-ai-gateway-system | 본체를 설치합니다. |
함정
설치 전에 확인하세요
- 1.0 에서 1.1 로 올릴 때 별도 절차가 필요하다고 배포 문서가 밝히고 있습니다. 그냥 차트만 올리면 안 됩니다.
- 정의와 본체를 나눠 설치합니다. 순서를 지키지 않으면 자원이 인식되지 않습니다.
- 두 단계 구조가 전제입니다. 한 단계만 두고 쓰면 설계가 의도한 분리가 사라집니다.
- 쿠버네티스 자원으로 설정을 표현합니다. 파일 하나로 끝나는 게이트웨이와 운영 방식이 다릅니다.
비교
가벼운 게이트웨이는 컨테이너 하나로 뜨고 관리 화면에서 설정합니다. 이쪽은 쿠버네티스 자원으로 표현되고 기존 트래픽 정책과 같은 층에서 다뤄집니다. 이미 그 기반을 운영 중이라면 도구를 늘리지 않는 선택이 되고, 아니라면 도입 비용이 큽니다.
최근 변경
안정 API 위의 첫 부 버전 배포입니다. 제공자별 토큰 집계와 요청별 상류 자격 증명, 스트림 유휴 제한과 장애 전환, MCP 호스트명 라우팅, 선택적 추적이 들어갔습니다.