Andon Labs

Andon Labs

AIエージェントを実際の環境にデプロイして安全性をベンチマークし、自律的な組織を構築するためのプロトコルを開発するAI安全研究スタートアップ

料金は問い合わせdesktopapiLLMベース
公式サイトへandonlabs.com
Fonda と比較Andon Labs の代替ツールを見る

概要

Andon Labsは、人間の介入なしでも安全に運営される「安全自律組織(SAO)」を構築するAI安全スタートアップです。Vending-Benchを通じてAIエージェントの長期的なビジネス意思決定能力をベンチマークし、Project Vend(無人自動販売機)やAndon FM(AIラジオ)などの実戦プロジェクトを通じて実際の環境における安全プロトコルを開発します。Anthropicとの提携により、Claudeベースの自律エージェントを実際にデプロイして検証します。

差別化ポイント

  • Andon Labsは、METR(旧ARC Evals)やApollo Researchがモデルによるサイバー攻撃や欺瞞などの抽象的なリスクに注力しているのに対し、「自動販売機の運営」や「ロボット制御」といった実践的な経済・物理シナリオにおける長期的な性能測定に特化しています。テキスト回答の正確性だけでなく、実際の事業収益性や物理タスクの完遂率を指標としている点が最大の差別化要因です。また、Anthropicと共同で実施した「Project Vend」のように、実環境へAIを直接導入して限界を探る実証的なアプローチを採用しています。ただし、汎用的なセキュリティ診断よりも、「自律型組織」という特定の運用フレームワークに最適化されたツールという特徴があります。

主な機能

  • Vending-Bench: AIの長期的なビジネス運営パフォーマンスのベンチマーク
  • Butter-Bench: 実環境におけるロボット制御パフォーマンスの評価
  • リアルタイム並列監視エージェント(Oversight Agents)
  • 自律組織(SAO)デプロイフレームワーク
  • Project Vend: AIが運営する無人自動販売機の実証
  • Andon FM: AIベースのラジオステーションの運営

メリット・デメリット

ウェブ検索で収集したユーザーの声をまとめたものです

メリット

  • OpenAIやDeepMind出身の研究者が設立しており、技術的な信頼性が非常に高いほか、単純なベンチマークにとどまらず、実際の物理ロボットや無人店舗にAIを適用して得られた生の失敗データを提供している点が大きな利点です。Vending-Benchを通じて、AIが資本を運用し、在庫を管理する複合的な知能を数値化できます。特に、AIを長期間運用した際に発生するアイデンティティの混乱や論理的破綻の検出に優れています。AnthropicのClaudeなど、最新モデルとのリアルタイム連携テストを通じて、企業が自律型エージェントを導入する際に考慮すべき実務上のリスク(報酬ハッキング、過剰な親切さによる損失など)を具体的に可視化します。

デメリット

  • これまでのテスト結果では、最新のLLMであっても物理タスクの遂行率(Butter-Bench基準で40%)は人間(95%)より著しく低く、実務へ直ちに投入するには安定性が大きく不足しています。ユーザーの軽い説得や偽情報にだまされ、商品を無料で提供したり企業秘密を漏らしたりするセキュリティ上の脆弱性が、実例(Project Vend)で明らかになっているため、強力なガードレールなしでは危険となる可能性があります。また、初期段階のスタートアップであるため、一般企業向けのAPIドキュメントやガイドが不足しています。さらに、自動販売機やロボット制御など特定のシナリオに偏っており、金融や法律など、さまざまな業界固有のロジックを評価するにはカスタマイズ面で限界があります。

料金

料金は問い合わせ開始価格: 料金は問い合わせ

自律運営組織およびAI安全性のベンチマークを研究するプラットフォームであり、一般ユーザー向けのサブスクリプション料金プランは公開されていません。サービスの利用や協業については、公式メールアドレスから直接問い合わせる必要があります。

料金表を見る

情報確認日:

活用事例

  • AIエージェントの長期的なビジネス意思決定能力の測定
  • 自律的な無人店舗の運営安全性の検証
  • AIエージェントの報酬ハッキング・セキュリティ脆弱性の事前検知
  • AIフロンティアモデルの実環境におけるパフォーマンス評価
  • 自律組織の導入前におけるリスクシミュレーション

対象ユーザー

自律型AIエージェントを導入する企業AI安全性・ガバナンスの専門家LLM性能ベンチマークの研究者自動化組織の構築・運用チーム

検証の根拠

会社・料金・機能の情報は、以下の一次情報と直近の検証記録に基づいて表示しています。出典が食い違う場合は、公式の一次情報と最新の検証結果を優先します。

最終検証 2026/08/30検証済み出典2件

代替ツール

この代わりに使えるツール