PDF OCR

スキャンしたPDFを選択

PDFのみ · 20 MB · 40 ページ

またはPDFを1つここにドロップ

PDFに選択できる文字ではなく、スキャンしたページ画像が入っている場合に使うツールです。ブラウザーでページを描画して光学文字認識(OCR)を行い、認識したプレーンテキストを確認、コピー、または.txtファイルとして保存できます。元のPDFはデバイス内に留まります。検索可能なPDFの作成やページレイアウトの再現は行いません。また、OCRの結果には誤りが含まれることがあります。

スキャンPDFから文字を抽出する方法

  1. 1

    文書の言語を選ぶ

    印刷された本文の主な言語を選びます。この選択に応じて、ブラウザーが使うOCRモデルが決まります。

  2. 2

    PDFを開く

    20 MB、40ページまでのPDFを選びます。元のファイルはブラウザー内に留まり、サーバーには送信されません。

  3. 3

    認識が終わるまで待つ

    ブラウザーが各ページを描画し、選択したOCRモデルで文字を読み取ります。認識を始める前にモデルファイルのダウンロードが必要な場合があります。

  4. 4

    結果を確認する

    氏名、数字、重要な箇所を元のページと照合してください。OCRの出力は下書きとして扱い、原文と比べて確認します。

  5. 5

    文字をコピーまたは保存する

    コピーでは結果をブラウザー内に保ちます。「TXTを端末にダウンロード」ならアップロードせずにプレーンテキストを保存できます。保護されたダウンロードページの作成は、別の任意操作です。

このツールで作成されるもの

出力はプレーンテキストです。各ページから認識した文字の前にページ番号が入ります。次の処理は行いません。

  • PDFに非表示のテキストレイヤーを追加する
  • 段組み、表、フォーム、元の書体を再現する
  • 見た目のページレイアウトを維持する
  • 文書を翻訳する
  • 認識結果が正しいか検証する

スキャン画像を残したまま検索できるPDFが必要な場合は、検索可能PDFに対応した専用ソフトやデスクトップOCRアプリを使ってください。

認識しやすい文書

OCRは印刷された文字を対象にしています。まっすぐで鮮明、かつ十分なコントラストがあるスキャンは、ぼやけた写真、色あせたファクス、傷んだページより認識しやすくなります。装飾書体、手書き、数式、詰まった段組み、複雑な表では、文字の誤りや順序の乱れが生じることがあります。

20 MB、40ページまでのPDFに対応します。認識は1ページずつ行われ、大きなページや高解像度のページでは多くのメモリを使うことがあります。ブラウザーのメモリが足りない場合は、PDFを小さく分割して別々に処理してください。

対応するOCR言語

英語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、オランダ語、ロシア語、日本語、中国語(簡体字)、韓国語、アラビア語から選べます。

ファイルを開く前に、文書の主な言語を選んでください。複数の言語や文字体系が混在するページでは、言語ごとに処理し直す必要がある場合があります。それでも、形の似た文字を取り違えることがあります。

認識結果の確認

結果を使う前に、必ず元のPDFと照合してください。特に次の内容は注意して確認します。

  • 氏名、住所、識別番号
  • 日付、金額、小数点、マイナス記号
  • 法律、医療、金融、安全に関する指示
  • 複数段の文書におけるページ区切りと読む順序

重要な文書の正式な写しとしてOCRの出力を扱わないでください。

ファイルの取り扱いとダウンロード

元のPDFはブラウザー内で読み取られます。操作用URLには含まれず、サーバーにも送信されません。ブラウザーは、PDF描画用ライブラリ、OCRライブラリ、選択した言語モデルをネットワーク経由でダウンロードする場合があります。

コピーでは認識した文字をブラウザー内に保ち、クリップボードへ書き込みます。TXTを端末にダウンロードでは、生成した.txtファイルをアップロードせずに保存します。ダウンロードページを作成を選んだ場合に限り、そのテキストファイルをアップロードして保護された結果リンクを作ります。ファイルは最長7日間保持されることがあります。この任意のアップロードに失敗しても、端末へのダウンロードは引き続き利用できます。

よくある質問

いいえ。ページの描画と認識を行う間も、元のPDFはブラウザー内に留まります。ブラウザーは必要なPDF描画用ライブラリ、OCRライブラリ、選択した言語モデルをダウンロードする場合があります。コピーと「TXTを端末にダウンロード」では、認識した文字もアップロードされません。生成したプレーンテキストがアップロードされるのは、別操作の「ダウンロードページを作成」を選んだ場合だけです。

いいえ。結果はページごとに分けたプレーンテキストです。元のPDFを書き換えたり、非表示のテキストレイヤーを追加したり、レイアウトを維持したりはしません。

元のページと照合してください。OCRは文字を取り違えたり、一部を省いたり、読む順序を変えたりすることがあります。法律、医療、金融、安全など重要な用途に使う前に、すべての情報を確認してください。

印刷された文字を対象にしています。手書き、数式、装飾書体は正しく認識できない場合があります。表内の文字を認識できても、行や列の構造はプレーンテキストに維持されません。

英語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、オランダ語、ロシア語、日本語、中国語(簡体字)、韓国語、アラビア語です。PDFを開く前に主な言語を選びます。

20 MB、40ページまでです。大きなページや細部の多いページではブラウザーのメモリが足りなくなる場合があるため、処理しにくい文書は小さなファイルに分割すると改善することがあります。

「TXTを端末にダウンロード」は、認識した文字から.txtファイルを作り、アップロードせずに保存します。「ダウンロードページを作成」を選ぶと、生成したファイルが保護された結果リンクへアップロードされ、最長7日間保持されることがあります。この任意のアップロードに失敗しても、端末へのダウンロードは利用できます。

関連ツール