
Grobid
機械学習ベースの学術文献PDF構造分析およびデータ抽出ライブラリ
無料WebAPICLIオープンソース韓国語
公式サイトへgithub.com
OpenEvidence と比較Grobid の代替ツールを見る概要
Grobidは、学術論文のPDFをTEI/XML形式の構造化データに変換する、機械学習ベースのオープンソースライブラリです。SciBERTなどのディープラーニングモデル(DeLFT)を統合して著者、所属、セクション、引用などを高精度で抽出し、REST APIとDockerによる大規模な並列処理が可能です。Semantic Scholarなど主要な学術プラットフォームで実際に使用されています。
差別化ポイント
- 著者、所属、引用、Sectionなど学術文書特有の論理構造をMLで認識し、大量論文を並列処理できる点が特徴です。
主な機能
- SciBERT・BidLSTMなどDeLFTベースのディープラーニングモデルの統合
- 高性能なREST APIに基づく大規模な並列処理をサポート
- Crossref・biblio-gluttonとの連携による書誌情報の自動補正
- CJK(日中韓)・アラビア語などの多言語サポート
- 数式・表・図のキャプションの精密抽出および座標情報の提供
- Apache 2.0ライセンスの完全無料オープンソース
メリット・デメリット
ウェブ検索で収集したユーザーの声をまとめたものです
料金
活用事例
- 大規模学術検索エンジンのインデックス作成パイプライン構築
- RAGシステム向けの高品質な論文データ前処理
- 自動引用分析および書誌ネットワークの構築
- デジタル図書館PDF資料の一括構造化
対象ユーザー
データサイエンティスト学術研究者デジタルライブラリ開発者
検証の根拠
会社・料金・機能の情報は、以下の一次情報と直近の検証記録に基づいて表示しています。出典が食い違う場合は、公式の一次情報と最新の検証結果を優先します。
最終検証 2026/08/30検証済み出典1件
代替ツール
この代わりに使えるツール



