PDF テキスト変換ツール

次へ:確認

PDF から文字を取り出す最速の方法です。このツールは PDF にすでに保存されているテキストレイヤーをページごとに読み取り、コピーしたり .txt ファイルとして保存したりできるプレーンテキストを返します。すべてブラウザー内で動くため、あなたの文書がアップロードされることはありません。最初に知っておくべき点が一つあります。ツールが読むのはファイル内にすでにある文字なので、スキャンや撮影した文書(テキストレイヤーのない画像)は空のまま出てきます。その場合は代わりに OCR ツールを使ってください。

PDF からテキストを抽出する手順

  1. 1

    PDF をアップロード

    ドラッグするかクリックして選びます。ファイルは端末に留まり、サーバーに送信されることはありません。

  2. 2

    テキストを抽出

    ツールが各ページのテキストレイヤーを読み取ってつなぎ合わせ、各ページの前に区切りを入れます。

  3. 3

    結果を確認

    抽出したテキストがボックスに一ページずつ表示され、そのまま確認できます。

  4. 4

    コピーまたはダウンロード

    クリップボードにコピーするか、.txt ファイルとして保存して別の場所で再利用します。

このツールが読めるもの、読めないもの

PDF の種類 結果
Word、Google Docs、ブラウザー、デザインツールから書き出したもの 全文をきれいに、抜けなく取得
正しいテキストレイヤーを持つデジタル PDF ページごとにテキストを抽出
PDF として保存したスキャンや写真(画像のみ) 空またはほぼ空:読み取る文字がない
パスワード保護された PDF 先に解除するまで読み取れない

ここに OCR はありません:スキャンには適したツールを

この抽出ツールは OCR(光学文字認識)を実行しません。PDF の中にすでにある文字をコピーするだけで、ピクセルを読み取ることはありません。ファイルがスキャンで何も返ってこない場合は、まず OCR ツールに通してください。画像を本物のテキストレイヤーに変え、その後で抽出できるようになります。

テキストの並び方

各ページは --- Page N --- の区切りで分けられ、どこでページが終わり次が始まるか分かります。テキストは PDF に保存された順序で取り出されます。ほとんどの文書は自然に読めますが、珍しい多段組みレイアウトの一部では段が入り混じることがあります。ツールは読み取り経路を推測せず、PDF に保存された順序に従うためです。

よくある使い方

  • AI モデルに入力する。 言語モデルが受け取るのは PDF ではなくプレーンテキストです。先に抽出しておくと、処理が速く予測しやすくなります。
  • 引用と検索。 PDF ビューアーの選択操作と格闘せずに一節をコピーできます。
  • コンテンツの再利用。 打ち直さずに、テキストを文書やメール、メモへ移せます。

よくある質問

いいえ。埋め込まれたテキストレイヤーを読み取りますが、スキャンはテキストレイヤーのない画像にすぎないため、空で返ってきます。スキャンや撮影した文書には OCR ツールを使い、その後でテキストを抽出してください。

いいえ。抽出はすべてあなたのブラウザー内、あなた自身の端末で行われます。PDF がサーバーに送信されることはなく、何も保存されません。

一部の PDF、特に多段組みレイアウトは、読む順序とは違う順序でテキストを保存しています。ツールは PDF に保存された順序に従うため、段が入り混じることがあります。ワープロから書き出した文書はほぼ常に正しく出力されます。

ロックされている間は開けません。まず PDF ロック解除ツールでパスワードを外し、その後でテキストを抽出してください。

関連ツール

このツールは他の言語でも利用できます