オープンソース
用語名をコピー
技術用語約1分で読めます
ソースコードを公開し、誰でも自由に閲覧・修正・配布できるようにする開発手法です。AI分野においては、2024年に発表された「オープンソースAI定義(OSAID)」に基づき、モデルの重みだけでなく、学習データの情報や訓練コードまでが透明性をもって公開され、再現や改善が可能なシステムを指します。
別名
Open SourceOSS
詳しい説明
オープンソースは、技術の透明性と共同の発展のために設計図であるソースコードを共有するモデルです。AIエコシステムでは、Hugging Faceを中心にモデルやデータセットが共有され、イノベーションを主導しています。特に2024年10月、オープンソース・イニシアティブ(OSI)は、モデルの重み、訓練コード、データに関する詳細情報を含める必要があるとする「オープンソースAI定義(OSAID)」v1.0を策定しました。これに伴い、商用利用の制限やデータの非公開状態にあるLlama 3などは、厳密には「オープンウェイト(Open Weights)」に分類されることもあります。したがって、ツール選定の際には単に公開されているかだけでなく、ライセンス条項(Apache 2.0など)やデータの透明性、カスタマイズの許容範囲を綿密に検討する必要があります。
ツール選定において重要な理由
特定企業のAPIに依存しない「ベンダーロックイン」からの脱却が可能になり、社内サーバーに直接構築することでセキュリティを高めることができます。また、企業固有のデータを学習させるファインチューニング(Fine-tuning)を通じて、ビジネスに最適化されたカスタムソリューションを作成するのにも有利です。
確認すべき点
- ライセンスがOSI(Open Source Initiative)の承認を受けた標準的なものか(Apache 2.0、MITなど)、あるいはカスタム制限があるか?
- 商用利用の際、ユーザー数の制限や個別のロイヤリティが発生する条項があるか?
- 学習データのソースや加工方法が公開されており、バイアス(偏向性)やセキュリティの監査が可能か?
- GitHubのスター数やコントリビューション活動など、コミュニティによるメンテナンスが活発なプロジェクトか?
主な例
PyTorch(フレームワーク)、Transformers(ライブラリ)、OLMo(学習データまで完全公開されたモデル)。一方で、Llama 3やMistralは重みは公開されているものの、ライセンスやデータの側面から「オープンウェイト」としての性質が強くなっています。
混同しやすい用語
Open Source AI
コードや重みだけでなく、学習データの情報まで公開され、誰でも同じ水準のモデルを再現できる状態。
Open Weights
学習済みの成果物(重み)はダウンロードして使用できるものの、学習プロセスやデータは非公開であるモデル(例:Llama、Gemma)。
関連用語
オープンウェイト (Open-weights)
AIモデルの根幹となる数値である重み(パラメータ)を公開し、ユーザーが外部APIを介することなく、自身のサーバーやローカル環境に直接インストールして稼働できるようにするモデルの配布方式です。
Hugging FaceAIモデル、データセット、デモを共有してコラボレーションを行う、世界最大のオープンソースAIプラットフォームです。数百万個の事前学習済みモデルを提供することで開発サイクルを短縮し、「AIのGitHub」と呼ばれるエコシステムの中核を担ってい...
ファインチューニング事前学習された人工知能モデルに特定のデータ셋を追加学習させ、特定のタスクやドメインに合わせて最適化するプロセスです。汎用モデルの一般的な知識を維持しつつ、特定の目的に必要な専門性や応答スタイルを精緻に調整する際に使用されます。