テキストからURL抽出
チャットログ、Markdown、メールスレッド、生HTMLを貼り付けると、含まれるすべてのhttp:///https://リンクを整理した一覧で取得できます。末尾の句読点を除去し、MarkdownやHTMLのリンク構文にも対応、完全に同一の重複は削除されるため、クローラーやアーカイバーへそのまま流し込めます。
URLの抽出手順
-
1
ソースを貼り付け
テキストやHTMLを投入します。引用符、山括弧、Markdownリンク構文、末尾の句読点は自動処理されます。
-
2
スキャンを実行
`http://`/`https://`リンクをすべて抽出し、末尾の句読点を除去、完全一致の重複を排除します。
-
3
件数を確認
見つかったユニークなURL件数と完全な一覧を表示します。
-
4
コピーまたはエクスポート
1行に1URLずつで、`curl -I`、アーカイバー、スクリーンショットサービス、Screaming Frogのシードに使えます。
URLとみなす条件
URLの検出は思っているより難しく、このツールは安全なルールを1つだけ守っています。認識するのは完全なhttp:///https://リンクのみで、それ以外はテキスト内に残ります。
認識する形
| 形式 | 例 |
|---|---|
| 絶対 HTTPS | https://example.com/path?q=1 |
| 絶対 HTTP | http://example.com |
| Markdownリンクのリンク先 | [text](https://example.com) |
| HTMLの絶対href | href="https://example.com" |
末尾の整形ルール
末尾の句読点は除去され、(https://example.com).はhttps://example.comになります。空白、引用符、山括弧、丸括弧、角括弧、カンマ、セミコロンでマッチは終了します。括弧を含むURLは最初の開き括弧で切り取られるため、Wikipediaの記事タイトルのようなURLは開き括弧までしか取得されません。
抽出しないもの
mailto:、tel:、ftp:など、http/https以外のスキーム。//cdn.example.com/asset.jsのようなプロトコル相対リンク。example.com/docs/introやwww.example.com/pageのような、スキームのない素のドメインやwww付きアドレス。#sectionのようなアンカーのみや、JavaScript系の擬似URL。
重複の扱い
完全一致の重複は削除されます。https://example.comは何度現れても1回として数えられますが、Example.comとexample.comは別のエントリとして残ります。リストは各URLが最初に現れた順番を保ちます。
後処理のコツ
- 正規形にするなら小文字化。
Example.comとexample.comを同じホストとして扱いたい場合は、出力を小文字にしてから再度重複を除去してください。 - 追跡パラメーターを除去。UTMクリーナーでアーカイブ前に除去しないと、ほぼ重複のURLが大量に並びます。
- ステータス確認。リスト確定前にブロークンリンクチェッカーで404を除外しましょう。
よくある質問
短縮URLが完全なスキーム付きで書かれている場合のみ対応します。bit.ly/xyz単体では取得されませんが、https://bit.ly/xyzなら通常のURLとして取得されます。本ツールはリダイレクトを追わないため、最終宛先が必要なら別途解決してください。
はい。hrefが完全なhttp:///https://URLの場合に取得できます。タグを含めずにhref値だけを抽出します。相対パスのhrefは取得されません。
そのまま保持されます。utm_*などの追跡パラメーターを除去したい場合は、抽出後にURLクリーナーを使ってください。
いいえ。テキストはリクエスト中に処理され、コンテンツは永続化もログ記録もされません。
関連ツール
文字数・単語数カウンター
エッセイ、投稿、キャプション、メタディスクリプション向けに、単語数・文字数・文数・段落数を、読了時間、音読時間、キーワード密度、Flesch可読性スコアとともにカウントします。
ディスレクシア対応テキスト変換ツール
貼り付けたテキストを短い段落と約72文字の行に整え直し、読みやすくします。結果をコピーして、あらゆる文書やメール、エディタに貼り付けられます。
コピーできる矢印記号
直線、二重線、斜め、折り返し、循環、三角形風のよく使うUnicode矢印をワンクリックでコピー。文書、チャット、デザインに使えます。
アナグラムジェネレーター
短い語を入力すると、重複した並べ替えを除き、表示件数を調整しながら文字の一意な並べ替えを確認できます。
ドメイン名ジェネレーター
1つのキーワードからドメイン名の候補を生成します。接頭辞、接尾辞、文字の重ね、数字の末尾を、一般的な6つのTLDで組み合わせます。
都市名ジェネレーター
世界観づくり、地図、ゲーム、物語、モックデータ向けに、架空の都市、町、村、首都の名前を生成し、各結果に短いメモを添えます。
このツールは他の言語でも利用できます
- Wydobywanie URL-ów z tekstu [PL]
- URLs aus Text extrahieren [DE]
- Trích xuất URL từ văn bản [VI]
- Extraire des URL du texte [FR]
- Metinden URL'leri Çıkarma [TR]
- Extrair URLs do Texto [PT]
- استخراج عناوين URL من النص [AR]
- Extrahera URL:er från text [SV]
- 텍스트에서 URL을 추출합니다 [KO]
- Extract URLs from Text [EN]
- 从文本中提取 URL [ZH]
- URL's extraheren uit tekst [NL]
- ดึง URL จากข้อความ [TH]
- Ekstrak URL dari Teks [ID]
- Extraer URLs del Texto [ES]
- Estrai URL dal testo [IT]
- Извлечение URL из текста [RU]