テキストから電話番号を抽出

散文、署名、またはスクレーピングされたHTMLを混在したテキストを貼り付けて、その中に含まれるすべての電話番号を抽出します。この抽出ツールは、北米式の(xxx) xxx-xxxx、欧州式のスペース区切り形式、コンパクトな国際形式の+CC...、およびユーザーがメールに入力する自由な形式(555.123.4567+44 20 7946 0958)を認識します。出力結果は元の形式で返されるため、後でlibphonenumberなどのライブラリと照合して標準化することが可能です。

電話番号を抽出する方法

  1. 1

    ソースを貼り付ける

    テキストを貼り付けます。連絡先ページ、メール署名、CSVエクスポート、チャットログなど。

  2. 2

    スキャンを実行します

    正規表現はテキストを走査し、少なくとも7桁の数字に加えて識別可能な区切り文字または国コードが含まれる数字列を検索します。

  3. 3

    一致した結果を確認する

    結果は1行に1件の候補で表示され、重複は自動的に除外されます。リストを見直して誤検出(注文番号や日付など)がないか確認し、紛れ込んだ場合は元のテキストを修正してください。

  4. 4

    コピーまたはエクスポート

    整理された一覧を、1行に1件の形式のプレーンテキストとして取得できます。CRMやダイヤラーにそのまま取り込めます。

認識できる電話番号の書式

電話番号は表記が乱れがちです。国ごとに独自の記法があるうえ、人はそのルールを守らないからです。この抽出ツールは、実際のテキストに現れる実用的な書式を対象にしています。

対応する形式(例)

形式 備考
E.164 +14155552671 標準形式。保存にはこれを使います。
国際・スペース区切り +44 20 7946 0958 スペースで区切られた英国の固定電話番号。
北米 NANP (415) 555-2671 市外局番を括弧で囲む形式。
北米・ドット区切り 415.555.2671 メール署名でよく見られます。
欧州のローカル形式 020 7946 0958 先頭にゼロが付く国内プレフィックス。
メキシコの10桁 55 1234 5678 国番号なし。

注目すべき偽陽性

  • 注文番号および追跡番号。 13桁のFedEx追跡番号はスペースを含めて記入した場合、電話番号のように見えることがあります。周囲の文脈を確認してください。
  • 日付。 2024 09 15はregexモードに応じて7桁以上のパターンと一致する可能性があります。ソースデータに日付が多数含まれている場合は、まず日付をフィルターしてください。
  • クレジットカード番号。 4xxx xxxx xxxx xxxx形式の16桁のグループが一致します。抽出前にPCIデータをマスクしてください。

ヒント:保存前に正規化してください

同じ実際の番号に対して入力の形がばらつくことが、CRMの重複排除で苦労する根本原因です。国ごとの規則を理解するライブラリ(libphonenumber、Pythonの phonenumbers、PHPの laravel-phone など)でひと通り処理すれば、すべてE.164形式に変換されます。これはデータベースに保存すべき唯一の形式です。

よくある質問

抽出ツールは生のマッチ結果を返します。国を推定するには、ダイヤリングコードおよび長さルールからなるデータパックが必要です。+CCプレフィックスのみに関心がある場合は、その部分が出力内容に文字通り保持されます。

抽出ツールはメインの番号だけを返します。555-2671 ext. 123のようなインラインの内線番号はマッチ結果に含まれません。厳格なE.164形式で保存する場合は、extxまたは#より後の部分を別フィールドに分けてください。

はい、米国の無料電話番号(800、888、877、866、855、844、833)は標準的なNANPパターンに該当します。英国の0800や同様の地域別無料電話番号も、通常の固定電話番号と見分けがつかないため登録されます。

抽出応答が返信された後は、入力内容のコピーは保存されません。処理はリクエスト内のメモリ内で行われます。

関連ツール

このツールは他の言語でも利用できます