GPU

インフラ
約1分で読めます

数千個のコアによる並列演算に特化したプロセッサであり、AIモデルの学習と推論性能を決定づける中核インフラです。グラフィックス処理にとどまらず、ディープラーニングの行列演算に最適化されており、最近では高帯域幅メモリ(HBM)を組み合わせて超巨大言語モデル(LLM)を実行するデファクトスタンダードとなっています。

別名
Graphics Processing Unit画像処理装置

詳しい説明

GPU(Graphics Processing Unit)は、数多くの単純な演算を同時に処理する並列構造により、AIモデルの学習と推論をCPUよりも数十倍以上高速に実行します。現在、NVIDIAのHopper(H100、H200)および次世代のBlackwell(B200)アーキテクチャが市場をリードしており、AMDのInstinct MI300シリーズが有力な対抗馬として挙げられます。現代のAIワークロードにおいては、単純な演算速度(FLOPS)と同様に、ビデオRAM(VRAM)の容量とメモリ帯域幅が重要です。VRAMが不足するとモデルをロードできず、帯域幅が狭いと推論速度(Token/s)が低下するためです。ユーザーはモデルのサイズと予算に合わせて、オンプレミスでの構築または専門のGPUクラウド(Lambda、RunPodなど)サービスを選択する必要があります。

ツール選定において重要な理由

GPUは、AIの性能においてボトルネックが発生する最大の要因です。選択したGPUのVRAM容量によって動作可能なモデルのパラメータ数が決定され、メモリ帯域幅によってユーザーへの応答速度が左右されます。特にBlackwellなどの最新プロセスは、前世代と比べて電力効率に優れており、運用コスト(TCO)削減に決定的な役割を果たします。

GPU選定時に確認すべき4つの事項

  • VRAM容量:モデルのサイズ(例:Llama-3 70B)を1枚 of GPUに収めることができるか?
  • メモリ帯域幅(HBM3eなど):1秒あたりのトークン生成速度がサービス要件を満たしているか?
  • 相互接続技術(NVLink):複数枚のGPUを接続した際に、データ損失なしに拡張が可能か?
  • ソフトウェアエコシステム:CUDA環境でのライブラリサポートがスムーズか?

用途別の最適なGPU例

LLMの学習および大規模な推論においては、NVIDIA H200(141GB)またはB200(192GB)が標準です。中・小規模モデルのコストパフォーマンスに優れたサーバー構築にはL40SやA6000 Adaが好まれ、ローカル開発環境ではRTX 4090や5090などのコンシューマー向けフラグシップGPUが広く使用されています。

混同しやすい用語

TPU(Tensor Processing Unit)

GoogleがTensorFlow/JAX演算に最適化して開発した専用アクセラレータで、Google Cloudでのみ使用可能です。

NPU(Neural Processing Unit)

スマートフォンやノートPCなどのエッジデバイスで、AI演算を効率的に処理するために設計された低電力プロセッサです。

関連用語

TPUNPU