チャンキング
用語名をコピー
データ約1分で読めます
長い文書を検索や埋め込み(Embedding)に適した小さな断片(チャンク)に分割する作業で、RAGの品質の土台となります。
別名
Chunking文書分割テキスト分割
詳しい説明
チャンキング(Chunking)は、長い文書を検索や埋め込み(Embedding)に適した小さな断片(チャンク)に分割する作業です。RAGシステムは文書を丸ごとではなく、チャンク単位で埋め込み化して保存し検索するため、どのように分割するかが検索精度と回答品質を大きく左右します。大きすぎると一つのチャンクに複数のトピックが混在して検索の精度が落ち、小さすぎると文脈が途切れてしまいます。段落・文単位での分割、一定のトークン長での分割、チャンク同士を部分的に重複させるオーバーラップ、文書構造(見出しや表)を活かした分割など、多様な戦略があり、データの性質に適した手法を選ぶことが極めて重要です。
ツール選定において重要な理由
RAGや文書検索ツールの回答品質は、チャンキングの戦略によって差がつくケースが多々あります。分割が雑であると、関連のない内容が混ざって検索結果が曖昧になり、表や見出しの構造を無視すると文脈が途切れてしまいます。ツールがチャンキング方式やチャンクサイズ・オーバーラップを調整できるか、表やコードなどの構造を保持できるかが検索精度を左右します。
ツールを選ぶ際に確認すべき点
- チャンクのサイズと重複(オーバーラップ)を調整できるか
- 段落・見出し・表などの文書構造を維持した分割に対応しているか
- 日本語の文の境界を正確に認識して分割できるか
- 分割結果を事前に確認・デバッグできるか
実際の適用例
製品マニュアルをもとにRAGチャットボットを作成する際、マニュアルをむやみに1,000文字単位で区切ると、一つの手順が二つのチャンクに分断されて検索精度が低下します。見出しや手順の構造を活かして分割し、少しずつオーバーラップさせることで、一つのチャンクの中に手順が完全に収まり、回答精度が向上します。
関連用語
RAG
RAGは、リアルタイムのデータベース検索結果をAIの回答に結合する技術です。単に文書を検索する「Naive RAG」を超えて、AIが自律的に検索と検証を繰り返す「エージェンティックRAG」へと進化しました。膨大なデータを追加学習なしに活用し...
エンベディングテキストや画像などの非構造化データをAIが演算できるように、意味を保持した高次元の数値ベクトルに変換する技術です。単なる数値化にとどまらず、データ間の文脈的な関係や類似度を数学的に表現します。
ベクトルデータベース高次元のベクトルデータを保存し、類似度に基づいた高速な検索をサポートする特化したデータベースです。非構造化データを数値化した埋め込み(Embedding)値を活用して、AIが意味的に類似した情報を素早く検索できるようにし、RAG(検索拡張生...
コンテキストウィンドウAIモデルが1回のリクエスト(プロンプト)で同時に処理および記憶できるデータ(トークン)の最大範囲です。モデルの「短期記憶」であり、作業スペースの大きさを意味します。