テキスト類似度チェッカー

次へ

そっくりに聞こえる2件のサポートチケット、競合の記事に似たブログ投稿、互いに写したように見える2つの商品説明。直感では重なっていると分かっていても、数値がほしいものです。このチェッカーは2つのテキストを比較し、2つのスコアを返します。単語の重なりは、2つのテキストが共有する固有語の割合、文字の類似度は、生の文字がどれだけ一致するかです。この2つを合わせると、テキストが語彙、言い回し、あるいはその両方を共有しているかが分かります。

類似度の測り方

  1. 1

    両方のテキストを貼り付ける

    1文から記事全体まで、長さは自由です。

  2. 2

    単語の重なり

    各テキストを小文字化し、固有語に分割します。Jaccardスコアは、共有語を異なる語の総数で割った値です。

  3. 3

    文字の類似度

    ツールは生の文字列も比較し、一致した文字の割合を報告します。

  4. 4

    2つのスコアを読む

    単語の重なりが高く文字の類似度が低めなら、同じ単語が違う順序で並んでいることを意味します。文字の類似度が高ければ、テキストは1文字ずつほぼ同一です。

各スコアが示すもの

スコア 範囲 測るもの 盲点
単語の重なり(Jaccard) 0-100% 2つのテキストに共通する固有語の割合 単語の順序と語の出現頻度を無視する
文字の類似度 0-100% 生の文字列がどれだけ一致するか 長さや小さな編集に敏感
  • 単語の重なりが100%近くなら、2つのテキストはほぼ同じ語の集合を使っています。
  • 文字の類似度が100%近くなら、テキストは1文字ずつほぼ同一です。
  • 大きな差(単語の重なりが高く、文字の類似度が低め)は、同じ語彙を違う配置にしていることを示します。

計算例

The quick brown foxThe quick red fox を比較します。

  • 単語の重なり: 60.00%(異なる5語のうち thequickfox を共有)
  • 文字の類似度: 83.33%(違うのは brownred だけ)

2つの数値を合わせると全体像が見えます。ほぼ同じ単語で、1語を除けばほぼ同じ文字です。

このツールがしないこと

これは表層的な文字列比較であり、剽窃や意味のチェッカーではありません。

  • 単語と文字を比較するため、同じ内容を別の言葉で述べた2つの文章はスコアが低くなります。
  • 公開された著作物のデータベースを持たないため、テキストが他所から写されたかどうかは分かりません。
  • 意味に基づく(意味的な)照合には埋め込みモデルが必要で、このツールはそれを使いません。

スコアは、ほぼ重複を素早く見つける手がかりとして使い、判定として使わないでください。

前処理のヒント

  • 定型文を取り除く(署名、ヘッダー、フッター)。比較前に除くと、両方のスコアが不自然に膨らむのを防げます。
  • 空白や散在する記号を正規化する。書式の違いが本当の内容の一致を覆い隠さないようにします。
  • 長さの差に注意する。長さが大きく違うと、短い方が長い方に含まれていても文字の類似度は下がるので、比較可能な範囲どうしを比べてください。

よくある質問

大まかな手がかりとしてのみです。貼り付けた2つのテキスト間の単語の重なりと文字の類似度を測るだけで、既存の著作物のデータベースを持たず、未知の出所からのコピーは検出できません。高いスコアは、より詳しく見る価値のあるほぼ重複を示すだけです。

あまりできません。書き換えが大半の単語を残していれば、単語の重なりは高いままです。しかし類義語に置き換えると、ツールは意味ではなく単語と文字を比較するため、両方のスコアが下がります。本当の言い換えを捉えるには、意味的な(埋め込み)モデルが必要です。

どちらのスコアも長いテキストを扱えますが、文字の類似度の比較はテキストが大きくなるほど遅くなります。素早い結果を得るには、各テキストを数千文字程度に抑えてください。

2つのテキストは比較のために当社のサーバーへ送信され、保存されません。比較は単純な単語と文字の照合で、第三者は関与しません。

関連ツール

このツールは他の言語でも利用できます