PDF OCR:スキャンPDFを文字認識
スキャンPDFや画像ベースのPDFを、トルコ語・英語・ドイツ語・スペイン語・イタリア語対応のOCRで検索・コピーできるようにします。日本語の文字認識には対応していません。
- スキャン→ → テキスト
- 最大 25 MB
- 登録不要
- TR · EN · DE · ES · IT
21 PDF OCR(文字認識)
- 01 選ぶ
- 02 処理
- 03 保存
HTTPS · 約 10 分後に削除
アプリ内ブラウザで開いています。確実にダウンロードするには ••• メニューから ブラウザで開く を選んでください。
準備完了。あとはワンクリック。
処理状況
ファイルをアップロード中
結果
読めるように。
0ページを検索可能に
うまくいきませんでした。
ゲスト上限
今日のゲスト変換回数を使い切りました。
無料アカウントを作れば、そのまま続けられます。30 秒で完了します。
- 1 日の上限がアップ
- 変換履歴をひとまとめに
- すべてのツールを 1 つのアカウントで
処理の流れ
- ファイルをアップロード中
- ファイルを確認中
- 文字を認識中
- 仕上げ中
待つのをやめても、サーバー上のコピーは自動で削除されます。
- HTTPS で暗号化して転送
- 約 10 分で削除
- 無料・登録不要
01
OCRとは?何ができるの?
OCR(光学文字認識)は、画像に写った文字を認識し、コンピューターで扱えるテキストに変換する技術です。スキャナーやスマホのカメラで作ったPDFは、各ページが実質的には写真なので、文書内を検索したり文字をコピーしたりできません。
PDF OCRツールは、各ページを300DPIで読み取って、選んだ言語(トルコ語・英語・ドイツ語・スペイン語・イタリア語)のテキストを認識し、検索可能なPDFを作成します。ページの見た目はそのままで、認識したテキストが透明なレイヤーとして背面に追加されるため、Ctrl+Fで検索したり、文字を選択してコピーしたりできます。なお、日本語の文字認識には対応していないため、日本語の文書では正しい結果が得られません。
02
スキャンPDFをOCRする3つのステップ
スキャンPDFをアップロード:上のエリアにファイルをドラッグするか、クリックして選択します(25MBまで)。
OCRを開始:「文字を認識」をクリックすると、ページが1枚ずつ読み取られます。ページ数の多い文書では数分かかることがあります。
検索可能なPDFをダウンロード:完了したらファイルをダウンロードし、文字の選択・コピーや文書内検索に活用します。
03
こんなときに便利です
古い書類のデジタル化:権利証書、契約書、公的な通知などのスキャンを、検索できるアーカイブにする。
ノート・書籍:スキャンした本の章から引用したり、内容を要約したりする。
事務作業:請求書や領収書の中から、特定の金額や会社名を検索する。
ほかのツールの下準備:OCR後のテキストをコピーして編集したり、PDFテキスト変換ツールで書き出したりする。
04
認識精度と制限
対応言語:文字認識はトルコ語・英語・ドイツ語・スペイン語・イタリア語に対応しています。変換前に文書の言語を選んでください(英語は常にあわせて認識されます)。日本語(漢字・ひらがな・カタカナ)には対応していないため、日本語の文書は正しく認識されません。そのほかの言語、特にラテン文字以外の文字も精度が下がります。
精度を上げるには:まっすぐで明るく、300DPI以上でスキャンしたページをお使いください。傾き・影・ぼやけのある写真では誤認識が増えます。
手書き文字:OCRは印刷された文字に強く、手書き文字の結果は大きくばらつきます。
出力サイズ:ページを高解像度で作り直すため、出力ファイルが元より大きくなることがあります。ファイルを小さくしたい場合はPDF圧縮ツールをご利用ください。圧縮してもテキストレイヤーは保持されます。
処理時間:ページを1枚ずつ読み取るため、ページ数が多いほど時間がかかります。
05
プライバシーと自動削除
ファイルは暗号化されたHTTPS通信でサーバーに送信されます。アップロードされた元のファイルは、処理が終わるとすぐに削除されます。作成されたファイルはダウンロードのために短時間だけ保存され、毎分実行される自動クリーンアップ処理によって、10分以上経過したファイルが完全に削除されます。結果ファイルは準備ができたらすぐにダウンロードすることをおすすめします。
ダウンロードリンクは、処理を開始したユーザーまたはブラウザセッションでのみ有効で、ファイルが他のユーザーと共有されることはありません。処理ログに記録されるのはファイル名、サイズ、処理の種類などの情報のみで、ファイルそのものは保存されません。
06
よくある質問
OCRはどの言語に対応していますか?
トルコ語・英語・ドイツ語・スペイン語・イタリア語に対応しています。「文書の言語」で言語を選んでください。日本語には対応していないため、日本語の文書は正しく認識できません。
OCR後はどんなファイルが得られますか?
元の見た目のまま、文書内を検索でき、文字をコピーできるPDFファイルが得られます。
手書き文字も認識できますか?
OCRは印刷された文字で最も良い結果が出ます。手書き文字の精度は、文字の読みやすさに大きく左右されます。
OCRにはどれくらい時間がかかりますか?
各ページを300DPIで1枚ずつ読み取るため、ページ数によって変わります。短い文書はすぐに終わりますが、長い文書は数分かかることがあります。
スキャンしたPDFをWordにできますか?
OCR後にテキストをコピーしてWordに貼り付けるか、PDFテキスト変換ツールで書き出せます。ただし、スキャンしたページ自体は画像のため、レイアウトを完全に保った編集可能なWord文書にはならない場合があります。
誤認識を減らすにはどうすればいいですか?
ページをまっすぐ、影のない状態で、300DPI以上でスキャンしてください。スマホで撮影する場合は、明るい場所で文書の真上から撮影しましょう。
ファイルは保存されますか?
いいえ。アップロードしたPDFは処理完了後に削除され、OCR済みのファイルも数分以内にサーバーから自動で削除されます。