トランスフォーマー

AI概念
約1分で読めます

自己注意(セルフアテンション)を核とし、入力シーケンスを並列処理するディープラーニングアーキテクチャで、現代のほとんどのLLMの基盤となっています。

別名
Transformerトランスフォーマーモデル

詳しい説明

トランスフォーマー(Transformer)は、2017年にGoogleが発表した論文「Attention Is All You Need」で提案されたディープラーニングアーキテクチャです。RNNやLSTMがシーケンスを先頭から順次処理していたのとは異なり、自己注意(Self-Attention)メカニズムによって入力のすべての位置を同時に参照します。これにより並列演算が可能となり、学習速度が向上し、離れた単語間の関係(長距離依存関係)も効果的に捉えることができます。GPT、BERT、Claude、Geminiなど、今日のほぼすべての大規模言語モデルがこの構造をベースにしており、テキストを超えて画像や音声の領域にも拡張されています。

ツール選定において重要な理由

今日使用されているチャットボット、コーディングアシスタント、翻訳ツールの大部分が、トランスフォーマー系のモデル上で動作しています。アーキテクチャ自体を直接扱う機会は少ないですが、モデルが一度に参照できる入力の長さ(コンテキストウィンドウ)や処理コストが、この構造のアテンション演算に起因していることを知ることで、長い文書の処理や、コスト・遅延の比較が必要なツールを選択する際の判断基準が明確になります。

モデルの基盤に関して確認すべき点

  • ツールが使用するモデルがコンテキストウィンドウ(一度に処理できるトークン数)をどの程度サポートしているか
  • 入力の長さが伸びたときに、応答の遅延やトークンコストがどのように増加するか
  • テキスト以外の画像・音声入力を同時に処理するマルチモーダルモデルであるか
  • オープンウェイトモデルか、API専用モデルであるかによる活用上の制約はないか

実際の適用例

数十ページにおよぶ契約書を一度に入力して主要な条項を抽出するには、モデルのコンテキストウィンドウがその長さに対応できる必要があります。トランスフォーマーのアテンションは入力が長くなるほど演算量が急激に増加するため、同じ作業であっても、モデルやツールによって処理可能な長さやコストが大きく異なります。

関連用語

LLMGPTアテンションBERT