テキストからメールアドレスを抽出

メッセージのダンプ、CSVの列、フォーラムのスレッド、HTMLの一部を貼り付けると、抽出ツールが認識できるすべてのメールアドレスを取り出します。出力は重複が除去され、CRMへのインポートやバウンス確認ツールにそのまま貼り付けられます。照合は、単純なa@bの正規表現が生む誤検出を避けつつ、RFC 5322の実用的な部分集合(プラスアドレス、ローカル部のドット、ドメインのハイフン)を網羅します。

テキストからメールアドレスを抽出する方法

  1. 1

    ソースを貼り付ける

    自由なテキスト、ログ、HTMLページ、エクスポートした連絡先リストなど、`local@domain.tld`のパターンを含むものを入力します。

  2. 2

    抽出ツールを実行する

    正規表現が完全なアドレスを走査し、その周囲の句読点を無視します。

  3. 3

    件数を確認する

    見つかった一意のアドレスの数と、完全なリストが得られます。

  4. 4

    リストをコピー

    1行に1件のリストとしてクリップボードにコピーするか、そのままスプレッドシートの列に貼り付けます。

有効なメールアドレスとみなされる条件

抽出ツールは、完全なRFC 5322の文法ではなく、実用的なメールアドレスの形式に従います。完全な文法では、最近のMTAが受け付けないアドレス(空白を含む引用符付きのローカル部、括弧内のコメントなど)まで許容されてしまうためです。照合が対象とする範囲は次のとおりです。

パターン要素 許容 拒否
ローカル部 a-z 0-9 . _ % + - 空白、引用符付き文字列、山かっこ
ドメイン a-z 0-9 . - 末尾のドット、ラベル内のアンダースコア
TLD 2文字以上のASCII英字 数字のみのTLD

対応する一般的な乱れた入力

  • 文中でアドレスの後に.,が続く場合、その句読点は取り込まれません。
  • mailto:のリンク内のメールアドレス、スキームは自動的に除去されます。
  • @のようなHTMLエンティティはデコードされないため、info@example.comのように書かれたアドレスは検出されません。
  • メールヘッダーで<山かっこ>に囲まれたアドレス。

出力の活用方法

  • 到達性の確認。 インポートの前に、リストをバウンス確認サービスに通してください。収集したリストには約10%の無効なアドレスが含まれることがよくあります。
  • 同意。 文書にアドレスが載っているからといって、その人が連絡を受けることに同意したとは限りません。連絡の前にGDPRや現地の法律を確認してください。
  • ローカル部でも重複を除去する。 john@gmail.comj.ohn@gmail.comはGmailでは同じ受信箱に届きます。本当に一意のアドレスが必要な場合は、ドットを正規化してください。

よくある質問

いいえ。抽出ツールは実在し解析可能なアドレスを対象とします。まず難読化された形式を元に戻すか、テキストを事前処理して[at]@に、[dot].に置き換えてください。

いいえ。照合は基本的なラテン文字のみを対象とするため、müller@straße.deは検出されません。抽出前に、アドレスをASCIIのpunycode形式(例:user@xn--strae-oqa.de)に変換してください。

いいえ、重複を残すオプションはありません。出力は重複が除去され、最初に出現した順序が維持されます。言及回数を数えたい場合は、元のテキストで数えてください。

いいえ。テキストはリクエストの処理にのみ使われ、データベースに保存されず、ログにも記録されず、ページのリンクにも追加されません。

関連ツール

このツールは他の言語でも利用できます