Unicode検索

謎の文字を入れてください。ユーザーが貼り付けた奇妙な空白、フォントプレビューのグリフ、正規表現を壊す絵文字など、すると検索はそのUnicodeコードポイント(U+XXXX)と16進数での生のUTF-8バイトを、1文字につき1行で返します。

Unicode文字を特定する方法

  1. 1

    文字を貼り付け

    1つのグリフでも文字列全体でも貼り付けられます:各文字が順番に分析されます。

  2. 2

    コードポイントを読む

    正規のU+表記を、大文字で少なくとも4桁までゼロ埋めして取得します。

  3. 3

    UTF-8バイトを調べる

    その文字がディスクや通信路で占める1〜4バイトのシーケンスを確認します。

  4. 4

    結果をコピー

    出力はCSV形式の表(文字、コードポイント、UTF-8バイト)で、表計算ソフトやバグ報告に選択して貼り付けられます。

検索でできる典型的な探偵仕事

ほとんどのUnicodeのバグは画面上で同じに見えます。通常のスペースをノーブレークスペースから、丸いアポストロフィをプライムから見分ける唯一の方法は、コードポイントを調べることです。

検索が解決するよくある落とし穴

見た目 実際は コードポイント
スペース ノーブレークスペース U+00A0
スペース 狭いノーブレークスペース U+202F
(なし) ゼロ幅スペース U+200B
(なし) ゼロ幅接合子 U+200D
アポストロフィ 右シングルクォーテーション U+2019
アポストロフィ プライム(フィート/分) U+2032
ハイフン エンダッシュ U+2013
ハイフン 改行しないハイフン U+2011

UTF-8バイトレイアウトひと目で

  • 1バイト、ASCII、U+0000 から U+007F(0xxxxxxx)
  • 2バイト、ラテン補助、アラビア、ヘブライ(110xxxxx 10xxxxxx)
  • 3バイト、CJK、ほとんどの記号(1110xxxx 10xxxxxx 10xxxxxx)
  • 4バイト、絵文字、まれな文字体系(11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

データベースの列が固定バイト長の場合、4バイトの絵文字は1つのグリフとしてレンダリングされても4つの枠を消費します、切り詰めバグのよくある原因です。

よくある質問

通常はファイル先頭のBOMマーカー(U+FEFF)か、ワープロからの迷子のゼロ幅接合子です。1つを検索に貼り付ければすぐに教えてくれます。それから単純な検索・置換で取り除けます。

はい。検索は文字ごとに反復処理するので、単語全体は1文字ごとに1行を、そのコードポイントとUTF-8バイトとともに生成します。

コードポイントは文字の抽象的な同一性です、U+00E9はどこに保存しても常に「é」です。UTF-8はコードポイントをバイトに変える複数のエンコードの1つです。同じ「é」はUTF-8では2バイト C3 A9 ですが、Latin-1では単一バイト E9 です。

はい。検索は当社のサーバーで計算されます。貼り付けた文字が送信されて解析され、コードポイントとUTF-8バイトがすぐに返されます。送信されたテキストは保存しません。

関連ツール

このツールは他の言語でも利用できます