このツールについて
アクセント・発音区別符号の除去は、アクセント付きテキストをプレーンな文字形式に変換します。café は cafe に、naïve は naive に、résumé は resume に、Zürich は Zurich になります。URL、スラグ、ファイル名、ユーザー名、検索キー、あるいはアクセントのない ASCII を期待する任意のシステム向けにデータを整えるのに理想的で、元のスペース、句読点、大文字小文字を保持します。
内部では Unicode 正規化を使用します。テキストは NFD 形式に正規化され、é のようなアクセント付き文字を基本の e と別の結合アクセントに分割し、それから結合発音区別符号ブロック(U+0300〜U+036F)のすべての文字を正規表現で除去します。この 1 ステップで、大半のヨーロッパのアクセントを基本文字についてきれいに、かつ可逆的に処理します。
一部の文字には正準分解がないため、小さな明示的フォールバックマップがそれらを扱います。ø→o、ł→l、đ→d、ß→ss、æ→ae、œ→oe、þ→th、ð→d、ħ→h、ı→i とその大文字などです。任意の「非 ASCII をすべて除去」の切り替えはさらに進んで、U+007F を超える残りの文字を落とし、純粋な ASCII の結果を保証します。すべて決定論的でブラウザ内でローカルに動作します。テキストがアップロードされることはありません。
よくある質問
アクセントはどう除去されますか?
テキストは Unicode NFD に正規化され、各アクセント付き文字を基本文字と結合記号に分離し、それからすべての結合発音区別符号(U+0300〜U+036F)が削除されます。なので é → e、ñ → n、ü → u となり、基本文字が保たれます。
ø、ł、ß のような文字はどうなりますか?
それらには正準分解がないため、内蔵のフォールバックマップが明示的に変換します。ø→o、ł→l、đ→d、æ→ae、œ→oe、þ→th、ß→ss とその大文字形式なので、それでも意味のあるプレーン文字になります。
非 ASCII をすべて除去するオプションは何をしますか?
発音区別符号を除去した後、U+007F を超える文字をすべて削除し、純粋な ASCII 出力を保証します。オフのままにすればマップされていない非ラテン文字(ギリシャ文字やキリル文字など)がそのまま残ります。オンにすればクリーンな ASCII のみの文字列を強制します。
私のテキストはどこかに送信されますか?
いいえ。すべての正規化と除去は String.normalize とプレーンな JavaScript でブラウザ内で完全に行われます。何もアップロードされないので、プライベートまたは機密のテキストも安全に整えられます。