그록

그록

Groq

자체 LPU 칩으로 오픈소스 모델을 빠르게 돌리는 추론 전용 클라우드 플랫폼입니다. GPU 기반 서비스보다 초당 토큰 생성량이 높고 첫 응답까지의 지연이 짧은 점이 핵심입니다.

무료 + 유료WebCLIAPI한국어LLM 기반멀티모달
웹사이트 방문하기groq.com
reverse-skill와(과) 비교하기그록 대안 모아보기

소개

그록(Groq)은 생성형 AI 모델을 직접 개발해 제공하는 서비스라기보다, 모델의 답변을 빠르게 계산해 애플리케이션으로 전달하는 추론 플랫폼입니다. 자체 설계한 LPU(Language Processing Unit) 칩과 이에 맞춘 소프트웨어 스택을 사용해 범용 GPU 중심 서비스와 다른 방식으로 추론 처리 경로를 최적화합니다. 사용자는 GroqCloud 콘솔에서 제공되는 모델을 선택해 요청을 보내거나, 기존 OpenAI 클라이언트 라이브러리의 기본 주소와 인증 키를 바꿔 OpenAI 호환 API로 연결할 수 있습니다. 따라서 API 구조를 새로 익히는 부담을 줄이면서 기존 대화형 AI, 음성 처리, 에이전트 애플리케이션에 적용하기 좋습니다. 특히 응답을 기다리는 시간이 서비스 품질에 직접 영향을 주는 개발자와 기업, 사용자 요청이 몰리는 실시간 제품 운영 환경을 주요 대상으로 합니다. 일반적인 모델 학습 플랫폼이나 범용 클라우드 컴퓨팅 서비스와 달리, 핵심 경쟁력은 모델을 만드는 기능보다 이미 공개된 모델을 일관된 지연 시간과 높은 처리 속도로 실행하는 데 있습니다. 기본 온디맨드 처리 외에도 사용량과 안정성 요구에 맞춰 서비스 계층을 선택할 수 있으며, 기업용 성능 계층은 낮고 일정한 지연 시간과 가용성 보장을 목표로 합니다. 다만 실제 사용 가능한 모델, API 기능, 호출 한도와 요금은 계속 바뀔 수 있으므로 도입 전 공식 모델 목록과 문서를 확인해야 합니다.

차별점

  • GPU의 메모리 대역폭 병목을 우회하도록 설계한 추론 전용 LPU 칩을 직접 만들어 씁니다
  • 동급 추론 서비스와 비교해 초당 처리량(TPS)이 수백~1,000 TPS 수준으로 높습니다
  • OpenAI 호환 API를 그대로 받아서, 코드 변경 없이 엔드포인트만 바꿔 마이그레이션할 수 있습니다

활용 워크플로우

입력

OpenAI 호환 API 요청 및 REST 엔드포인트GroqCloud Playground 실험 및 설정 데이터Python/TypeScript SDK 기반 모델 통합 코드멀티모달 입력 (이미지 및 오디오 바이너리 스트림)

그록

LPU(Language Processing Unit) 전용 컴파일러 최적화SRAM 기반의 고대역폭 데이터 텐서 스트리밍 (TSP 아키텍처)확정적(Deterministic) 하드웨어 스케줄링 및 병렬 연산실시간 토큰 디코딩 및 스트리밍 엔진 처리

출력

초당 500+ 토큰(TPS) 기반의 실시간 텍스트 응답JSON Mode를 통한 구조화된 데이터 객체Whisper 기반 초고속 오디오 전사 및 번역 결과물Groq Compound 기반 멀티 툴 호출(Tool Use) 인스트럭션

실시간 음성 에이전트 워크플로우

Whisper Large V3 Turbo를 활용해 수 초 분량의 오디오를 밀리초 단위로 텍스트화하여 즉각적인 대화형 AI 서비스 구현

대규모 지식 베이스 RAG 최적화

Llama 3.3 70B 모델의 높은 처리량을 이용해 방대한 컨텍스트 내에서 필요한 정보를 지연 시간 없이 추출 및 요약

에이전틱 워크플로우 통합

Groq Compound 시스템을 통해 웹 검색, 코드 실행 등 외부 도구를 자동 선택하고 병렬로 처리하는 복합 추론 경로

핵심 차별점: 전용 LPU 칩과 SRAM 기반 아키텍처로 메모리 병목을 제거하여, 기존 GPU 대비 수십 배 빠른 토큰 생성 속도와 일정한 지연 시간을 보장합니다.

주요 기능

  • LPU 기반 저지연 추론 인프라
  • OpenAI 호환 API
  • Llama, GPT-OSS, Qwen, Kimi, MiniMax 등 주요 오픈 모델 지원
  • 텍스트 생성, 음성 인식, 음성 합성, OCR 지원
  • Remote MCP와 커넥터 기반 외부 도구 연동
  • 프롬프트 캐싱과 배치 처리 할인 옵션

장점 & 단점

웹검색을 통해 수집된 사용자 피드백 정보입니다

장점

  • 같은 오픈 모델을 GPU 기반 서비스에서 돌릴 때보다 초당 토큰 생성량이 높습니다
  • 추론 작업에 맞춘 모델별 종량제로, 1M 토큰당 단가가 미리 공개되어 비용 계산이 명확합니다
  • 첫 토큰까지 걸리는 시간(TTFT)이 짧아 실시간 대화형 서비스에 적합합니다
  • 성능 확인과 소규모 개발용으로 무료 티어를 쓸 수 있습니다
  • 장기적인 운영 비용(토큰당 비용) 절감 효과
  • 경쟁사 GPU 대비 압도적으로 빠른 LLM 추론 속도
  • 예측 가능한 성능을 보장하는 결정론적(Deterministic) 아키텍처
  • 기존 GPU 솔루션 대비 우수한 에너지 효율성

단점

  • GPT-4와 같은 폐쇄형 모델은 사용할 수 없음
  • 플랫폼에서 지원하는 특정 오픈 소스 모델로 활용 범위 제한
  • 무료 티어 사용 시 엄격한 속도 및 요청 제한 적용
  • AI 모델 학습(Training)이 아닌 추론(Inference)에만 특화됨
  • GPU 대비 범용성이 떨어져 다양한 연산 작업에는 부적합
  • 칩당 메모리 용량이 적어 대형 모델 구동 시 많은 칩 연결 필요
  • Nvidia CUDA 생태계에 비해 상대적으로 작은 개발자 커뮤니티
  • 무료 티어 사용량 제한 및 고급 기능의 학습 곡선 존재

가격 정보

무료 + 유료시작 가격: Free (pay-per-token)

Groq Cloud는 토큰당 종량제로 청구되며, 394~1,000 TPS의 초고속 추론을 제공합니다. 모델별 1M 토큰 기준: Llama 3.1 8B Instant 입력 $0.05/출력 $0.08(840 TPS), GPT OSS 20B 입력 $0.075/출력 $0.30(1,000 TPS), Llama 3.3 70B 입력 $0.59/출력 $0.79(394 TPS). 추가로 TTS는 1M 문자당 $22~, Whisper 음성 인식은 시간당 $0.04-$0.111, Built-in 도구(검색·코드 실행)는 1,000 요청당 $0.18-$8입니다. 프롬프트 캐시는 50% 할인, Batch API는 비동기 워크로드 50% 할인이며 Free tier도 제공합니다.

정보 확인일:

활용 사례

  • 지연 시간이 거의 없는 실시간 고객 지원 챗봇
  • 대규모 텍스트 데이터의 고속 요약 및 분류
  • 초고속 실시간 음성 인식(Whisper) 및 번역 서비스
  • 지능형 에이전트 및 멀티모달 애플리케이션 개발

대상 사용자

실시간 AI 서비스를 구축하려는 소프트웨어 엔지니어인프라 비용 효율성을 극대화하고자 하는 AI 스타트업대규모 오픈 소스 LLM을 빠르고 안정적으로 운영하려는 기업

태그

클라우드개발자 도구텍스트 생성코드 생성

검증 근거

회사·가격·기능 정보는 아래 원문과 최근 검증 기록을 기준으로 표시합니다. 서로 다른 출처가 충돌하면 공식 원문과 최신 검증값을 우선합니다.

최근 검증 2026. 09. 02.검증 출처 2개

최근 소식

확인된 변경 내역

공식 변경 내역 보기

사용자 리뷰

리뷰를 불러오는 중...

대안 도구

이 도구 대신 사용할 수 있는 대안