概要
スキャンしたPDFから文字を抽出するには、Batch Printerにファイルをアップロードし、文書の言語を選んでOCRを実行します。処理後は検索やコピーができるPDFをダウンロードでき、元のスキャン画像の見た目は保たれます。
PDFにOCRをかける方法
スキャンしたPDFから文字を抽出する手順
- 1
スキャンPDFをアップロード
スキャンしたPDFファイルをドラッグ&ドロップします。
- 2
言語を選択
文書内のテキストの言語を選びます。
- 3
処理してダウンロード
OCRをクリックして文字を抽出し、検索可能なPDFをダウンロードします。
よくある質問
どの言語に対応していますか?
OCRは英語、韓国語、日本語、中国語、ほとんどのヨーロッパ言語を含む複数の言語に対応しています。
OCRで手書きメモも読めますか?
OCRはタイプされた文字で最も高い精度を発揮します。整った手書きなら一部認識できる場合がありますが、手書きの精度は印刷文書より低くなります。
OCR後も元のページレイアウトは維持されますか?
はい。検索可能なテキストレイヤーを追加しながら、ページの見た目はほぼ同じままです。元のスキャンの書式も引き続き確認できます。
OCRの精度を上げるにはどうすればよいですか?
300 DPI以上のスキャンを使い、ページをまっすぐにし、コントラストを強くしてください。OCR前に暗い余白をトリミングすることも認識品質の向上に役立ちます。
OCR後にテキストをコピーできますか?
はい。OCRが成功すると、ほとんどのPDFリーダーでテキストを選択して検索できます。精度はスキャン品質と言語選択によって変わります。
OCR PDFの実用的な使い方
法律事務所はスキャン済みの事件記録にOCRをかけ、ディスカバリー準備中に弁護士が数百ページから氏名、日付、条項を検索できるようにします。
研究者は歴史的な記事や印刷レポートをOCR処理し、引用を抽出して、手入力なしで検索可能な文献アーカイブを作ります。
経理チームは請求書スキャンをOCR処理し、監査や照合作業で明細項目や取引先IDを検索できるようにします。
OCR PDFのヒントとベストプラクティス
- 標準的な文書は最低300 DPI、小さな文字は400 DPIでスキャンしてください。
- 文字の置き換えミスを減らすため、処理前に文書の主言語を選択してください。
- 傾いたページや上下逆のページは先に回転してください。文字の位置がずれるとOCR精度は大きく下がります。
- 強く圧縮された元スキャンは避けてください。圧縮ノイズが文字検出を混乱させることがあります。
- 抽出データを業務で使う前に、合計、日付、氏名などの重要項目を確認してください。