GenieX

퀄컴 기기의 NPU 와 GPU 에서 모델을 돌리는 온디바이스 런타임

curl -fsSL https://qaihub-public-assets.s3.us-west-2.amazonaws.com/qai-hub-geniex/install.sh | sh

퀄컴 칩이 든 기기에서 언어 모델과 시각 언어 모델을 지역 실행합니다. 허깅페이스의 거의 모든 GGUF 모델이나 퀄컴이 미리 컴파일한 묶음을 가져와 신경망 처리 장치와 그래픽 장치, 중앙 처리 장치 중 하나에서 돌립니다. 밑에는 C SDK 하나가 있고 그 위에 명령줄과 파이썬, 코틀린과 자바, 도커, 오픈AI 규격 서버가 얹혀 있습니다. 윈도우 ARM64 노트북과 안드로이드 휴대폰, 리눅스 ARM64 사물인터넷 기기를 지원합니다. 기기가 없으면 퀄컴이 운영하는 원격 기기 클라우드에서 시험합니다. 퀄컴 스냅드래곤에서만 돌아갑니다.

판단

이럴 때 씁니다

  • 퀄컴 기기에서 모델을 지역 실행할 때
  • 신경망 처리 장치를 실제로 쓰고 싶을 때
  • 온디바이스 앱에 모델을 넣을 때

이럴 땐 쓰지 마세요

  • 퀄컴 칩이 아니면 아예 안 돕니다
  • 인텔이나 애플 실리콘은 대상이 아닙니다
  • 판이 0.6 대라 규격이 움직입니다

차별점

  • 신경망 처리 장치와 그래픽 장치, 중앙 처리 장치를 골라 씁니다.
  • C SDK 하나 위에 명령줄과 여러 언어 SDK, 서버가 얹혀 있습니다.
  • 허깅페이스 모델과 미리 컴파일된 묶음을 모두 받습니다.
  • 기기가 없어도 원격 기기 클라우드에서 시험합니다.

워크플로

  1. 01플랫폼에 맞는 방식으로 설치합니다.
  2. 02허깅페이스 모델이나 미리 컴파일된 묶음을 고릅니다.
  3. 03한 줄로 추론을 돌려 봅니다.
  4. 04필요하면 오픈AI 규격 서버를 띄웁니다.
  5. 05앱에는 해당 언어 SDK 로 붙입니다.

주요 명령

명령설명
curl -fsSL https://qaihub-public-assets.s3.us-west-2.amazonaws.com/qai-hub-geniex/install.sh | sh리눅스 ARM64 에 관리자 권한 없이 설치합니다.
geniex infer google/gemma-4-E4B-it-qat-q4_0-gguf허깅페이스 모델로 바로 대화합니다.
geniex infer ai-hub-models/Qwen2.5-VL-7B-Instruct미리 컴파일된 묶음을 신경망 처리 장치에서 돌립니다.

함정

설치 전에 확인하세요

  • 퀄컴 스냅드래곤에서만 돌아갑니다. 다른 칩에서는 설치해도 소용없습니다.
  • 두 가지 실행 방식이 있습니다. 일반 모델과 미리 컴파일된 묶음의 성능과 지원 범위가 다릅니다.
  • 윈도우는 설치 프로그램을 받아 실행한 뒤 터미널을 새로 열어야 합니다.
  • 판이 0.6 대입니다. 인터페이스가 바뀔 수 있습니다.

비교

온디바이스 추론 도구는 대개 중앙 처리 장치나 그래픽 장치만 씁니다. 이쪽은 전용 가속기까지 열어 전력과 속도에서 차이를 냅니다. 대신 특정 제조사 칩에 완전히 묶입니다.

최근 변경

시각 언어 모델이 정확도 모드에서 대화 형식이 적용되지 않던 문제를 고쳤습니다. 서명된 가속기 카탈로그가 함께 배포되어 인증서를 따로 가져올 필요가 없어졌습니다.