AI Deck

PaddleOCR ─ 表・数式・印影まで構造ごと読み取る、Baidu発のオープンソースOCRツールキット

Baiduが開発するオープンソースのOCR(光学文字認識)ツールキット。画像やPDFから文字を読み取るだけでなく、表・数式・レイアウト構造・印影までを保ったままMarkdownやJSONに変換できる。2026年には文書解析特化のビジョン言語モデル「PaddleOCR-VL」や、汎用OCRの最新版「PP-OCRv6」がリリースされ、精度と処理速度の両面で改良が続いている。

主な特徴

  • 構造を保った文書変換: 請求書や契約書などのレイアウトが複雑な文書でも、表・数式・段組みの構造を崩さずMarkdownやJSONへ変換できる
  • 軽量版と高性能版の使い分け: 単一モデルで50以上の言語に対応する軽量版から、100以上の言語のテキスト検出・認識に対応する高性能版まで、用途に応じて選べる
  • PaddleOCR-VL による文書解析: 軽量なビジョン言語モデルを使い、不規則なレイアウトの実文書でもテキスト・表・数式をまとめて解析する
  • 表・数式・印影・グラフの認識: 一般的なOCRでは扱いにくい表構造、数式、印影、グラフの読み取りに対応
  • クラウドAPIとローカル実行の両対応: AI Studio経由のクラウドAPI、自前サーバーへのセルフホスト、Pythonライブラリとしてのローカル実行のいずれでも利用できる

料金

PaddleOCR本体はオープンソース(Apache 2.0)で無償利用できる。クラウドAPI(AI Studio経由)には無料枠に加えて利用量に応じた有料プランがあるが、料金体系は変動するため最新の内容は公式サイトをご確認ください。

メリット・デメリット

メリット

  • オープンソースのため無償で自由に利用・改変でき、ローカル実行すればデータを外部に送らずに処理できる
  • 表・数式・印影など、一般的なOCRが苦手とする構造化文書の解析に強い
  • MCPサーバーに対応しており、Dify・RAGFlowなどのAIエージェント基盤やLLMアプリケーションへの組み込みが容易
  • 軽量版から高性能版まで揃っており、エッジデバイスからサーバーサイドまで用途に応じて選べる

⚠️ デメリット

  • 高性能版のモデルは相応の計算リソースを要するため、GPUなしの環境では処理速度が伸びにくい
  • 公式サイト(AI Studio)は中国発のサービスで、ドキュメントや管理画面の一部に中国語表記が残る
  • セルフホストや高度なカスタマイズには、Python・機械学習まわりの知識がある程度必要になる

類似サービスとの比較

比較項目PaddleOCRTesseractdocTR
開発元BaiduGoogle(コミュニティ管理)Mindee
表・レイアウト構造の解析対応(PP-StructureV3等)非対応一部対応
多言語対応50〜100以上の言語100以上の言語主に欧文言語中心
GPU活用時の処理速度高速CPU中心で低速中程度
ライセンスオープンソース(Apache 2.0)オープンソース(Apache 2.0)オープンソース(Apache 2.0)

こんな人におすすめ

  • 請求書・契約書など、表や数式を含む複雑な文書をテキスト化したい人
  • RAGやAIエージェントに文書読み取り機能を組み込みたい開発者
  • データを外部に送らず、ローカル環境でOCR処理を完結させたい人
  • 多言語の文書を扱う必要があり、無償のOCRツールを探している人

まとめ

PaddleOCRは、単なる文字認識にとどまらず表・数式・印影までを構造ごと読み取れる、オープンソースの文書解析ツールキットである。クラウドAPIとローカル実行のどちらも選べる柔軟さと、MCPサーバーによるAIエージェントとの連携のしやすさが強みだが、高性能版を活かすにはある程度の計算リソースが必要になる。

関連リンク

← ブログ