画面ではまったく同じに見える文字列なのに、コンピューターでは別のデータとして扱われることがある。たとえばアクセント付きの「é」は、一文字として記録する方法と、「e」にアクセント記号を組み合わせる方法がある。
人間には同じ文字に見えても、内部の符号の並びが異なれば、単純なデータ比較では一致しないことがある。ファイル名や検索、ユーザー名などで、思わぬすれ違いの原因になる。
この違いを整理する仕組みがUnicodeの「正規化」だ。NFCなどの形式にそろえると、同じ意味の文字の並びを統一して比較しやすくなる。ただし、見た目が似ているすべての別文字まで同じものにするわけではない。