トークン
用語名をコピー
データ約1分で読めます
LLMがテキストを認識して生成する基本単位であり、文章を単語や文字よりも小さい意味の断片に分割したものです。AIモデル의 演算コスト、応答速度、一度に記憶できる情報量(コンテキストウィンドウ)を決定する重要な指標です。
別名
Tokenトークン化
詳しい説明
トークンは、AIが言語をデータ化する「最小の粒子」です。文章はトークナイザー(Tokenizer)を経て数値形式のトークンに変換され、モデルはこれを通じて文脈を把握します。過去には、英語と比べて韓国語のトークン効率が低く、同じ内容でも2〜3倍のコストが発生していましたが、GPT-4oの「o200k_base」やClaude 3などの最新モデルはトークナイザーの効率を改善し、韓国語の処理コストと速度を大幅に最適化しました。トークンは単なるテキストの単位を超えて、APIの課金額やモデルの「記憶容量」を測定する標準的な基準として活用されます。
ツール選定において重要な理由
トークンは、AIサービスの運営における経済性と性能に直結します。同じ文書であっても、モデルのトークナイザーの効率によって課金額が異なり、コンテキストウィンドウ内にどれだけの情報を収められるかが決定されます。特に韓国語環境では、モデルごとの韓国語トークン圧縮率を確認することがコスト最適化の鍵となります。
ツール選定時の確認事項
- 該当モデルが最新のトークナイザー(例:GPT-4oのo200k)を使用し、韓国語(ハングル)の効率が改善されているか?
- 入力(Input)と出力(Output)トークンの単価の差が予算の範囲内にあるか?
- 長い文脈を処理する際、トークン制限(コンテキストウィンドウ)が業務に対して十分であるか?
モデル別の韓国語トークン処理の例
英語の「Apple」は通常1トークンですが、韓国語の「사과(りんご)」はモデルによって大きな差があります。過去のGPT-4(cl100k_base)では、韓国語の1文字が約2〜3トークンを消費していましたが、最新のGPT-4o(o200k_base)は圧縮効率が約1.5倍以上改善され、より少ないトークンで同じ韓国語の文章を処理できるようになりました。
テキスト測定単位の比較
Character(文字)
空白を含む個々の文字数。人間が体感するテキスト量。
Word(単語)
スペース区切りの単位。英語圏で主に使われる基準。
Token(トークン)
AIの内部処理単位。コストとモデルのメモリ占有量の実際の基準。
関連用語
コンテキストウィンドウ
AIモデルが1回のリクエスト(プロンプト)で同時に処理および記憶できるデータ(トークン)の最大範囲です。モデルの「短期記憶」であり、作業スペースの大きさを意味します。