パラメータ
用語名をコピー
データ約1分で読めます
AIモデルが学習を通じて保存する内部変数(重み・バイアス)です。数値が大きいほど複雑なパターンを学習できますが、演算・メモリコストも同時に増加します。
別名
Parameter媒介変数重み
詳しい説明
パラメータ(Parameter)は、人工ニューラルネットワークの内部で入力データに掛けられ、足される重み(Weights)とバイアス(Biases)の総和です。AIモデルが学習プロセスを通じて自ら最適化する「内部知識」の単位であり、主に「B(Billion、10億個)」という単位を用いてモデルの規模(クラス)を表します。パラメータ数が多いほど、モデルはより膨大なデータの相関関係を学習し、高度な推論やクリエイティブなタスクを実行できます。しかし、パラメータが増えるほど、モデルの実行に必要な演算リソース(VRAM)や推論時間(レイテンシ)も増加するため、一概に大きいモデルを選ぶのではなく、使用目的と運用環境に最適化された規模を選択することが重要です。
ツール選定において重要な理由
パラメータ数は、AI導入時の経済性と性能を決定する尺度です。70B以上の大規模モデルは複雑な論理推論に有利ですが、運用コストが高くなります。一方、特定の分野의 データで十分に学習された7B〜13Bクラスのモデル(SLM)は、低コストでありながら特定の業務で巨大モデルに匹敵する性能を発揮できます。
確認すべき点
- 保有しているGPUのメモリ(VRAM)が、選択したモデルのパラメータ規模を処理できるか?
- 単純なテキスト分類や要約タスクに、過剰に大きなパラメータのモデルを使用していないか?
- パラメータ数に対するベンチマーク(MMLUなど)の性能効率が優れた最新アーキテクチャのモデルか?
例
Llama 3 8Bモデルはパラメータ数が少なく、一般のコンシューマー向けPCでも動作可能で、迅速な応答が必要な場合に向いています。一方、GPT-4(数兆個と推定)やLlama 3 400B+モデルは、高度な法律・医療の専門知識や複雑なプログラミングサポートが必要な場合に使用されます。
混同しやすい用語
ハイパーパラメータ(Hyperparameter)
モデルが自ら学習するのではなく、人間が学習開始前に直接設定する制御値(例:学習率、バッチサイズ)です。
トークン(Token)
モデルの知能の大きさであるパラメータとは異なり、モデルが一度に処理または生成するデータの量的な単位です。
関連用語
ファインチューニング
事前学習された人工知能モデルに特定のデータ셋を追加学習させ、特定のタスクやドメインに合わせて最適化するプロセスです。汎用モデルの一般的な知識を維持しつつ、特定の目的に必要な専門性や応答スタイルを精緻に調整する際に使用されます。
MoE (Mixture of Experts)モデルの全パラメータのうち、入力トークンの処理に必要な一部の「エキスパート」サブネットのみを選択的に活性化させることで、巨大モデルの知識容量と効率的な演算速度を同時に両立するニューラルネットワークアーキテクチャです。