このツールの機能
アクセントの削除は、テキストの残りの部分を変更せずに、アクセント付き文字と特殊文字を通常の文字に変換します。「á」は「a」、「ñ」は「n」、「ç」は「c」になります。あらゆる言語から発音記号を取り除き、ワンクリックでアクセント付きのテキストをきれいな ASCII 対応文字に変換します。
アクセントを削除する理由
多くのシステムは依然としてアクセント付き文字を適切に処理できません。ユーザー名、電子メール アドレス、ファイル名、URL スラッグ、データベース キー、レガシー ソフトウェアでは、多くの場合、アクセントのない普通の文字が必要です。 「José」のような名前や「São Paulo」のような都市がこれらのシステムのいずれかに適合する必要がある場合、アクセントを削除すると互換性のあるバージョンが作成されます。また、検索や照合のためにテキストを正規化するためにも使用され、「カフェ」と「カフェ」は同じものとして扱われます。
仕組み
このツールは、Unicode 正規化を使用して各文字をアクセント記号から分離し、基本文字をそのまま残してマークを削除します。これは、フランス語、スペイン語、ポルトガル語、ドイツ語などの言語にまたがって機能し、アキュート、グレーブ、サーカムフレックス、チルダ、ウムラウト、セディラなどの幅広い発音記号を処理します。基礎となる文字とその他すべてのテキストは、そのまま残ります。
アクセントを維持する場合
アクセントの削除は互換性のためであり、表示のためではありません。テキストが人々に読まれるあらゆる状況において、出版された文章、ユーザーに表示される名前、正式な文書、アクセントは正しいスペルの一部であり、保持する必要があります。ポルトガル語では「サンパウロ」と「サンパウロ」は同じように正しくありません。このツールは、適切にアクセントが付いたテキストの一般的なクリーンアップとしてではなく、システムがプレーン レターを要求する場合に使用します。
アクセントを取り除きたいとき
アクセント記号と発音記号を削除すると、á、é、ñ、ç、ü などの文字が、通常の形式の a、e、n、c、u に変換されます。これは、システムが基本的な ASCII 文字のみを受け入れる場合、つまり、名前からのユーザー名または電子メールの生成、URL スラッグの作成、レガシー データベース用のデータの準備、「Jose」が「José」と一致するように検索用語を正規化する場合、またはオペレーティング システム間で機能するファイル名を作成する場合に必要になります。単語は読める状態のままで、発音区別符号のみが削除されます。
アクセント除去の仕組み
内部では、アクセント付きの各文字が基本文字と結合マークに分解され、マークは破棄され、基本文字が残ります。これが、何も変更せずに「カフェ」が「カフェ」になり、「ピニャータ」が「ピニャータ」になる理由です。スペイン語、ポルトガル語、フランス語、ドイツ語など、多くの言語のアクセントを 1 回のパスで処理します。一部の非ラテン文字はこの方法では分解されないため、このツールはラテン語ベースの言語に最も役立ちます。
アクセント、検索、データマッチング
アクセントを削除する一般的な理由は、検索と一致を寛容にするためです。データに「São Paulo」が格納されているが、ユーザーが「São Paulo」と入力した場合、両方をアクセントのない形式に正規化することで一致させることができます。同じことが、アクセント付きまたはアクセントなしで同じ名前が表示されるリストの重複を除去する場合にも当てはまります。比較前にアクセントを削除すると、ほぼ重複したものが完全一致に変わります。これは、クリーンなデータと信頼性の高い検索に不可欠です。