FreeToken

게이밍 PC 에서 거대 전문가 혼합 모델을 돌리는 추론 엔진

uv pip install "freetoken[accel]"

개인용 하드웨어에서 거대한 전문가 혼합 구조 모델을 돌리도록 만든 추론 엔진입니다. GPU 와 CPU, 호스트 메모리, 연결 대역을 하나의 탄력적인 자원으로 보고 대역폭에 맞춰 CPU 와 GPU 가 나눠 계산합니다. 전문가 캐시를 전역 최근 사용 기준으로 관리하고 선처리를 이중 버퍼로 흘려보냅니다. 에이전트가 도구 호출이나 사고 블록을 중간에 고쳐도 맥락을 통째로 다시 계산하지 않도록 의미 기준점을 잡아 두는 캐시가 특징입니다. 전문가 캐시와 키 값 메모리 사이의 VRAM 배분을 엔진 재시작 없이 실시간으로 바꿉니다. 주요 코딩 도구와 붙는 호환 API 를 제공합니다.

판단

이럴 때 씁니다

  • 가정용 GPU 로 큰 전문가 혼합 모델을 돌려야 할 때
  • 에이전트가 맥락을 자주 고쳐 재계산 비용이 클 때
  • VRAM 배분을 실행 중에 조정하고 싶을 때

이럴 땐 쓰지 마세요

  • 엔비디아 최신 세대 GPU 를 전제로 합니다
  • 판이 0.1.x 대의 초기 배포입니다
  • 작은 밀집 모델에는 이 구조의 이점이 없습니다

차별점

  • 대역폭에 맞춰 CPU 와 GPU 가 계산을 나눠 갖습니다.
  • 에이전트가 맥락 중간을 고쳐도 재계산을 피하는 의미 기준점 캐시가 있습니다.
  • 전문가 캐시와 키 값 메모리 사이 VRAM 배분을 재시작 없이 바꿉니다.
  • 여러 양자화 형식과 최신 오픈 모델을 폭넓게 지원합니다.

워크플로

  1. 01데스크톱 앱이나 CLI 로 설치합니다.
  2. 02돌릴 모델과 양자화 형식을 고릅니다.
  3. 03CPU 와 GPU 분담 정책을 확인합니다.
  4. 04호환 API 주소로 코딩 도구를 붙입니다.
  5. 05필요하면 실행 중에 메모리 배분을 조정합니다.

주요 명령

명령설명
uv pip install "freetoken[accel]"가속 확장을 포함해 설치합니다.
uv pip install -e ".[accel]"저장소를 받아 직접 빌드합니다.

함정

설치 전에 확인하세요

  • 엔비디아 RTX 30 이상 세대를 기본 지원 대상으로 잡고 있습니다. 다른 하드웨어에서는 이점이 줄어듭니다.
  • 첫 정식 배포가 최근입니다. 판이 0.1.x 대이므로 구성 방식이 바뀔 수 있습니다.
  • 전문가 혼합 구조에 최적화된 엔진입니다. 일반 밀집 모델에는 설계상 이점이 크지 않습니다.
  • 의미 기준점 캐시는 에이전트가 맥락 중간을 고치는 상황을 전제로 합니다. 그 패턴이 아니면 효과가 작습니다.

비교

로컬 추론 엔진은 대체로 모델을 메모리에 올릴 수 있느냐로 갈립니다. 이쪽은 전문가 혼합 구조의 특성을 이용해 필요한 부분만 오가게 만들어, 원래는 못 올릴 크기를 개인 기계에서 굴리는 쪽을 노립니다. 대신 하드웨어 전제가 뚜렷합니다.

최근 변경

패키지 저장소 문제를 바로잡은 첫 정식 배포입니다. 판 번호가 아직 0.1.x 대입니다.