PDF OCR:スキャンPDFを文字認識

スキャンPDFや画像ベースのPDFを、トルコ語・英語・ドイツ語・スペイン語・イタリア語対応のOCRで検索・コピーできるようにします。日本語の文字認識には対応していません。

  • スキャン → テキスト
  • 最大 ⁦25 MB⁩
  • 登録不要
  • TR · EN · DE · ES · IT

21 PDF OCR(文字認識)

  1. 01 選ぶ
  2. 02 処理
  3. 03 保存

HTTPS · 約 10 分後に削除

スキャン

選択したファイル

サイズ: 準備完了

準備完了。あとはワンクリック。

処理状況

ファイルをアップロード中

結果

読めるように。

0ページを検索可能に

うまくいきませんでした。

文書の言語

選んだ言語に加えて、英語も常に認識します。

  • アカウント不要、無料です。
  • トルコ語・英語・ドイツ語・スペイン語・イタリア語の文字を認識します。
  • ファイルは処理後およそ 10 分で削除されます。

まず PDF を選んでください

処理の流れ

  1. ファイルをアップロード中
  2. ファイルを確認中
  3. 文字を認識中
  4. 仕上げ中

待つのをやめても、サーバー上のコピーは自動で削除されます。

ファイルをダウンロード

自動削除まで 10:00

その後サーバーから完全に削除されます。今すぐダウンロードしてください。

01

OCRとは?何ができるの?

OCR(光学文字認識)は、画像に写った文字を認識し、コンピューターで扱えるテキストに変換する技術です。スキャナーやスマホのカメラで作ったPDFは、各ページが実質的には写真なので、文書内を検索したり文字をコピーしたりできません。

PDF OCRツールは、各ページを300DPIで読み取って、選んだ言語(トルコ語・英語・ドイツ語・スペイン語・イタリア語)のテキストを認識し、検索可能なPDFを作成します。ページの見た目はそのままで、認識したテキストが透明なレイヤーとして背面に追加されるため、Ctrl+Fで検索したり、文字を選択してコピーしたりできます。なお、日本語の文字認識には対応していないため、日本語の文書では正しい結果が得られません。

02

スキャンPDFをOCRする3つのステップ

  1. スキャンPDFをアップロード:上のエリアにファイルをドラッグするか、クリックして選択します(25MBまで)。

  2. OCRを開始:「文字を認識」をクリックすると、ページが1枚ずつ読み取られます。ページ数の多い文書では数分かかることがあります。

  3. 検索可能なPDFをダウンロード:完了したらファイルをダウンロードし、文字の選択・コピーや文書内検索に活用します。

03

こんなときに便利です

  • 古い書類のデジタル化:権利証書、契約書、公的な通知などのスキャンを、検索できるアーカイブにする。

  • ノート・書籍:スキャンした本の章から引用したり、内容を要約したりする。

  • 事務作業:請求書や領収書の中から、特定の金額や会社名を検索する。

  • ほかのツールの下準備:OCR後のテキストをコピーして編集したり、PDFテキスト変換ツールで書き出したりする。

04

認識精度と制限

  • 対応言語:文字認識はトルコ語・英語・ドイツ語・スペイン語・イタリア語に対応しています。変換前に文書の言語を選んでください(英語は常にあわせて認識されます)。日本語(漢字・ひらがな・カタカナ)には対応していないため、日本語の文書は正しく認識されません。そのほかの言語、特にラテン文字以外の文字も精度が下がります。

  • 精度を上げるには:まっすぐで明るく、300DPI以上でスキャンしたページをお使いください。傾き・影・ぼやけのある写真では誤認識が増えます。

  • 手書き文字:OCRは印刷された文字に強く、手書き文字の結果は大きくばらつきます。

  • 出力サイズ:ページを高解像度で作り直すため、出力ファイルが元より大きくなることがあります。ファイルを小さくしたい場合はPDF圧縮ツールをご利用ください。圧縮してもテキストレイヤーは保持されます。

  • 処理時間:ページを1枚ずつ読み取るため、ページ数が多いほど時間がかかります。

05

プライバシーと自動削除

ファイルは暗号化されたHTTPS通信でサーバーに送信されます。アップロードされた元のファイルは、処理が終わるとすぐに削除されます。作成されたファイルはダウンロードのために短時間だけ保存され、毎分実行される自動クリーンアップ処理によって、10分以上経過したファイルが完全に削除されます。結果ファイルは準備ができたらすぐにダウンロードすることをおすすめします。

ダウンロードリンクは、処理を開始したユーザーまたはブラウザセッションでのみ有効で、ファイルが他のユーザーと共有されることはありません。処理ログに記録されるのはファイル名、サイズ、処理の種類などの情報のみで、ファイルそのものは保存されません。

詳しくはプライバシーポリシーをご覧ください

06

よくある質問

OCRはどの言語に対応していますか?

トルコ語・英語・ドイツ語・スペイン語・イタリア語に対応しています。「文書の言語」で言語を選んでください。日本語には対応していないため、日本語の文書は正しく認識できません。

OCR後はどんなファイルが得られますか?

元の見た目のまま、文書内を検索でき、文字をコピーできるPDFファイルが得られます。

手書き文字も認識できますか?

OCRは印刷された文字で最も良い結果が出ます。手書き文字の精度は、文字の読みやすさに大きく左右されます。

OCRにはどれくらい時間がかかりますか?

各ページを300DPIで1枚ずつ読み取るため、ページ数によって変わります。短い文書はすぐに終わりますが、長い文書は数分かかることがあります。

スキャンしたPDFをWordにできますか?

OCR後にテキストをコピーしてWordに貼り付けるか、PDFテキスト変換ツールで書き出せます。ただし、スキャンしたページ自体は画像のため、レイアウトを完全に保った編集可能なWord文書にはならない場合があります。

誤認識を減らすにはどうすればいいですか?

ページをまっすぐ、影のない状態で、300DPI以上でスキャンしてください。スマホで撮影する場合は、明るい場所で文書の真上から撮影しましょう。

ファイルは保存されますか?

いいえ。アップロードしたPDFは処理完了後に削除され、OCR済みのファイルも数分以内にサーバーから自動で削除されます。