PDFから画像を抽出

PDF をアップロード

PDFファイルをアップロードすると、すべての埋め込み画像が元の解像度で復元されます。抽出ツールはPDFのオブジェクト構造を走査し、/XObject /Image形式のデータ項目を検出し、各画像をPNG形式で出力します。スクリーンショット化も不要であり、ページ全体をラスタ化しても画質の損失が生じません。スキャン画像、写真の多いレポート、製品カタログやパンフレットにも対応しています。

PDFから画像を抽出する方法

  1. 1

    PDFをアップロードしてください

    1つのファイルをアップロードしてください。暗号化されたPDFはまずロック解除が必要です。

  2. 2

    オブジェクトツリーをスキャンします

    抽出ツールは、すべてのページに存在するすべてのイメージXObjectを列挙します。

  3. 3

    結果をプレビューします

    各画像は、ページ番号とサイズを含むサムネイルとして表示されます。

  4. 4

    個別にまたはZIPファイルとしてダウンロードします

    単一のアセットを取得するか、すべてを「`image-p1-1.png`」という名前のアーカイブとしてエクスポートしてください。

画像がPDF内にどのように保存されているか

PDFは画像をページコンテンツから参照される個別のリソース(/XObjectストリーム)として保存します。抽出ツールは各ストリームをそのネイティブエンコーディングで読み込み、作成者が埋め込んだファイルを再構築します。

表示されるフォーマット

PDFフィルター 受け取れる形式 通常のソース
/DCTDecode PNG(JPEG由来) 写真、製品写真、スキャン画像
/FlateDecode + RGB PNG ロゴ、グラフ、UIスクリーンショット
/JPXDecode PNG(JPEG 2000由来) 高解像度のアーカイブスキャン画像
/CCITTFaxDecode PNG(スキャン由来) 白黒でスキャンされたテキスト
/JBIG2Decode PNG(変換済み) 圧縮されたスキャン文書

抽出ツールが出力するのは常にPNGです。生のピクセルをブラウザ内で再エンコードするため、JPEG、JPEG 2000、CCITTの画像もPNG形式で届きます。

復元できない項目

  • ベクトルイラスト。 PDFのパスオペレーターを使用して作成されたロゴは画像ではなく、コンテンツストリーム内に存在し、XObjectとして扱われません。これらについてはPDFからSVGへの変換ツールをご利用ください。
  • **背景色およびグラデーション。**これらは埋め込み資産ではなく、ページレベルの描画要素です。
  • アウトライン化されたテキスト。「グラフィックス」のように見えますが、画像オブジェクトではありません。

エクスポートを扱う際のヒント

  • 寸法を確認してください。 ページ上の300x300のサムネイルは、実際にはレンダリング時に縮小された3000x3000のオリジナル画像である可能性があります。取得できるのは表示サイズではなく、元のピクセル数です。
  • ライセンスを遵守してください。 画像を抽出できるからといって、それを再利用する権利が与えられるわけではありません。PDF内のストック画像は抽出後もストック画像のままです。
  • スキャンしたドキュメント。 すべてのページがテキストが組み込まれた巨大な画像として出力されている場合、そのPDFはスキャンファイルです。エクスポートされたPNGファイルに対してOCRを実行してテキストを復元してください。

よくある質問

PDFページでは、画像の描画方法に変換行列(反転、回転、歪め)を適用できます。抽出ツールは保存されたビットマップ(生ピクセル)を返します。出版者が画像を逆さまに保存し、レンダリング時に反転させた場合、エクスポートした画像は逆さまに表示されます。任意の画像編集ソフトで再び回転処理を行うとよいです。

ロックを解除した後にのみ実行できます。まずファイルをPDFロック解除ツールで処理し、所有者のパスワードを入力してから抽出してください。

はい。画像はページ順に追加され、各ファイル名にページ番号が含まれます。例えば「image-p1-2.png」のようになるため、各画像がどのページから来たのかが分かります。

いいえ。元のPDFはブラウザ内で完全に開いて読み取られ、サーバーに送信されることはありません。アップロードされるのは、抽出した画像のZIPファイルだけです。セッション保護された結果を作成するためであり、最長7日間保持された後、削除されます。

関連ツール

このツールは他の言語でも利用できます