LMDeploy

LMDeploy

大規模言語モデルの圧縮、推論、サービスをサポートする効率的なオープンソースツールキット

無料LinuxAPICLIオープンソース韓国語LLMベースマルチモーダル
公式サイトへgithub.com
book-to-skill と比較LMDeploy の代替ツールを見る

概要

LMDeployは、LLMおよびVLMモデルの圧縮、デプロイ、サービングを行うためのオープンソースの高性能ツールキットです。TurboMindエンジンベースのAWQ・FP8・MXFP4量子化と、DeepSeek V3・R1などの大型MoEモデルの効率的な分散推論をサポートしています。2026年5月のv0.13.0リリースを通じて、CUDA 12.8の標準サポートおよびGeForce RTX 50シリーズの互換性を追加しました。

差別化ポイント

  • TurboMindによる高速推論とメモリ効率に強みがあり、InternLM、Llama、Qwenなど主要オープンモデルへ最適化された配信環境を提供します。

主な機能

  • TurboMind & PyTorchのデュアル推論エンジンによる最高パフォーマンスの提供
  • AWQ、FP8、MXFP4量子化およびKVキャッシュ圧縮のサポート
  • Persistent Batching & Paged Attentionの最適化
  • Vision-Language Model(VLM)のオフライン・オンラインサービング
  • DeepSeekのPD分離(Disaggregation)および分散デプロイのサポート
  • 投機的デコーディング(Speculative Decoding)および構造化出力(JSON Mode)
  • NVIDIA、AMD、Ascendなどマルチアクセラレータのサポート

メリット・デメリット

ウェブ検索で収集したユーザーの声をまとめたものです

メリット

  • 高スループット・低レイテンシを重視し、AWQなどの量子化にも対応します。OpenAI互換APIを提供し、新しいモデルへの対応も継続的です。

デメリット

  • 主にLinux環境向けで、WindowsやmacOSでのローカル検証は面倒な場合があります。設定項目が多く最適化には学習が必要です。

料金

無料開始価格: Free (open source)

オープンソースで無料です。公式の有料プランはなく、利用者がGitHubから取得して自前インフラへ配備します。

料金表を見る

情報確認日:

活用事例

  • エンタープライズ級の高性能LLM・VLM APIサーバーの構築
  • 低遅延リアルタイムマルチモーダルチャットボットサービスの運営
  • DeepSeek R1などの大型MoEモデルの効率的なGPU分散サービング
  • エッジ・ローカル環境向けモデルの量子化および軽量化

対象ユーザー

AIエンジニアMLOps専門家バックエンド開発者

検証の根拠

会社・料金・機能の情報は、以下の一次情報と直近の検証記録に基づいて表示しています。出典が食い違う場合は、公式の一次情報と最新の検証結果を優先します。

最終検証 2026/08/30検証済み出典1件

代替ツール

この代わりに使えるツール