PDF・文書処理 / Open Source

PaddleOCR
Adobe Acrobat OCR のオープンソース代替。 多言語の文字認識。レイアウト解析もできる。
健全度スコア
健全度
- スター × 0.2590,183
- フォーク × 0.511,406
- コントリビュータ × 0.5295
- ウォッチャー × 0.25570
- 更新の新しさ − 日数 × 0.59日前
スター・フォーク・コントリビュータ・ウォッチャー・更新の新しさの5項目から算出した、プロジェクトの勢いの目安です。上から5つの目盛りが、その5項目を表します。 スターなどの数値はGitHubの公開情報、更新日は最終コミット日をもとにしています。減点は最終コミットから90日で頭打ち(最大 −45点)になります。数値が大きいほど活発ですが、規模の大きいプロジェクトほど有利になる指標です。
スコアの読み方と目安は選び方のページにまとめています。
スペック
- スター
- 90,183
- フォーク
- 11,406
- コントリビュータ
- 295
- ウォッチャー
- 570
- ライセンス
- Apache-2.0
- 主な言語
- Python
- 最終コミット
- 2026/09/169日前
- 公開開始
- 2020/05/08
- Docker対応
- 非対応
- 日本語ドキュメント
- あり(公式)
- 健全度
- 28,534
ライセンス表記は「Apache-2.0」。最終コミット2026/09/16時点の情報です。
公式の説明(英語)
Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages. - PaddlePaddle/PaddleOCR
トピック
ai4sciencechineseocrdocument-parsingdocument-translationkieocrpaddleocr-vlpdf-extractor-ragpdf-parserpdf2markdownpp-ocrpp-structurerag
このツールを自前で動かすには
OSSセルフホストでよく選ばれる4つのVPSをまとめました。
DigitalOcean
ドキュメントが豊富でAPI・CLIも充実。Docker前提のOSS運用に強い。
公式サイトで詳細を見るVultr
海外リージョンが豊富で時間課金。検証用にも本番にも使いやすい。
公式サイトで詳細を見るXserver VPS
ConoHa VPS
この記事にはアフィリエイトリンクが含まれる場合があります。ただし、掲載内容はossalt.jpの編集方針に基づいて選定しています。
Adobe Acrobat OCR の代替候補を比較
| ツール | 代替対象 | スター | ライセンス | Docker対応 | 健全度 | セキュリティ |
|---|---|---|---|---|---|---|
| Adobe Acrobat OCR | 9.0万 | Apache-2.0 | 非対応 | 28,534 | Security4.4 | |
| Adobe Acrobat OCR | 7.7万 | Apache-2.0 | 非対応 | 25,119 | Security5.6 |
乗り換えを検討するときは、機能の一致度より「移行コスト」と「運用コスト」で見るほうが失敗しにくいです。下の表でライセンスとDocker対応を確認してください。
同じカテゴリのツール
- Stirling PDF (Adobe Acrobat の代替)
- Tesseract (Adobe Acrobat OCR の代替)
- Paperless-ngx (Adobe Acrobat の代替)
- OCRmyPDF (Adobe Acrobat の代替)
- PDFsam (Adobe Acrobat の代替)