【ゆにこーどせいきか】
Unicode正規化 とは?
最終更新:
💡 同じ文字の別表現をそろえる「文字列の整頓」
Unicodeで等価と定められた文字列を、決められた共通の形にそろえる処理。見た目が同じでも内部の並びが違う文字列を比較しやすくします。
📌 このページのポイント
同じ「が」なのに、文字列が一致しないことがあるの?
あるよ。「が」1つのコードポイントで表す方法と、「か」に結合用の濁点を続ける方法があるんだ。見た目は同じでも、そのまま内部の並びを比較すると一致しない場合があるね。
どうやってそろえるの?
NFKCというのも同じようなもの?
NFKCは互換等価も扱うので、たとえば「①」を「1」に変えるよ。NFCならこの違いは残るんだ。検索で便利な場合はあっても、元の表記の区別が必要な文章に無条件で使うと情報を失うね。
正規化すれば、似た文字を全部まとめられるの?
📖 おまけ:英語の意味
「Unicode Normalization」 = Unicode文字列を正規の形にそろえること
💬 normalizationは一定の形にそろえることで、ここではUnicodeが定めた規則を使うんだよ