
Promptfoo
プロンプトとモデルのパフォーマンスを体系的に比較分析する開発者向けテストフレームワーク
無料+有料WebCLIAPIオープンソース韓国語LLMベースマルチモーダル
公式サイトへpromptfoo.dev
book-to-skill と比較Promptfoo の代替ツールを見る概要
Promptfooは、LLMプロンプトの品質をテストおよび評価するためのCLIベースのオープンソースツールです。複数のモデルとプロンプトの組み合わせをマトリックス形式で構成してパフォーマンスを比較し、決定論的テストやAIベースの評価を通じて、回答の正確性、安全性、コストなどを分析します。CI/CDパイプラインに統合することで、プロンプト変更時に発生する可能性のあるパフォーマンス低下を事前に防止する機能を提供します。
差別化ポイント
- CLIと可視化ダッシュボードの両方を提供し、通常評価だけでなくRed Team機能でPrompt Injectionや有害出力などの安全性を体系的に検証できます。
主な機能
- GPT、Claude、Gemini、DeepSeekなど、複数モデルの同時パフォーマンスベンチマーク
- プロンプトインジェクション・PII流出など、50種類以上の脆弱性に対するレッドチームスキャン
- GitHub Actions・GitLab CI連携による自動回帰テスト
- LLM-as-judge方式のAIベースの出力品質評価
- JSONスキーマ・コスト・レイテンシしきい値のアサーション(Assertion)設定
- エージェントおよびRAGパイプラインのテストのサポート
- Transformers.jsのローカル推論および適応型レート制限(2026)
メリット・デメリット
ウェブ検索で収集したユーザーの声をまとめたものです
メリット
- 導入が簡単でローカル実行でき、データを外部へ出さず評価できます。大量のテストケースを並列実行し、モデル・プロンプト別の結果を比較しやすいです。
デメリット
- 複雑な評価設定にはYAMLの理解が必要で、大量テストでは各モデル提供元のAPI費用が増えます。
料金
無料+有料開始価格: Free (Community)
Community版はオープンソースで無料です。チーム協業、管理クラウド、高度セキュリティを含むEnterpriseはカスタム見積もりです。
情報確認日:
活用事例
- プロンプト変更前後のパフォーマンス回帰をCI/CDで自動的にブロック
- 複数のLLMモデルにおける回答の品質・コスト・速度のマトリックス比較
- エージェントシステムのセキュリティ脆弱性およびジェイルブレイク(脱獄)可能性の検証
- RAGパイプラインの回答の正確性およびコンテキスト忠実度の測定
対象ユーザー
プロンプトエンジニアAI製品開発者QA・セキュリティエンジニアMLOps担当者
検証の根拠
会社・料金・機能の情報は、以下の一次情報と直近の検証記録に基づいて表示しています。出典が食い違う場合は、公式の一次情報と最新の検証結果を優先します。
最終検証 2026/08/30検証済み出典1件
代替ツール
この代わりに使えるツール



