UTILS.
%100 tarayıcıda
🔤

Unicode Karakter İnceleyici

Herhangi bir dizeyi kod noktalarına ayırın ve her birinin U+ hex, kategori, blok, UTF-8/UTF-16 baytları, HTML entity'si, JS kaçışı, yüzde kodlaması ve bayraklarını gösterin.

Her karakteri incelemek için yukarıya metin girin.

Bu araç hakkında

Unicode Karakter İnceleyici, bir dizeyi tek tek kod noktalarına ayırır ve her biri hakkında her şeyi gösterir. 16-bit birim yerine kod noktasına göre yineler, bu yüzden vekil çiftlerinden oluşan astral karakterler ve emojiler doğru şekilde ele alınır. Her kod noktası için glifi, U+XXXX hex değerini, ondalık değeri, iyi bilinen karakterler için bir adı, genel kategoriyi ve ait olduğu Unicode bloğunu alırsınız.

Tüm analiz algoritmik olarak tarayıcınızda türetilir ve hiçbir şey yüklenmez. Kodlamalar ilk ilkelerden hesaplanır: UTF-8 baytları 1'den 4'e kadar bayt kodlama kurallarını izler, UTF-16 kod birimleri BMP'de tek bir birimdir veya üzerinde bir yüksek/düşük vekil çiftidir (D800–DBFF / DC00–DFFF), HTML sayısal entity'si &#nnnn;'dir, JavaScript kaçışı BMP için \uXXXX veya astral kod noktaları için \u{XXXXX}'tir ve yüzde kodlaması, UTF-8 baytlarının %XX olarak yazılmasıdır. Genel kategori (Lu, Ll, Nd, Mn, Zs, Cc vb.) Unicode özellik-kaçış düzenli ifadeleriyle algılanır.

İnceleyici, genellikle hatalara neden olan veya metni gizlemek için kullanılan karakterleri işaretler: sıfır genişlikli karakterler (200B–200D, 2060, FEFF), çift yönlü kontroller (200E, 200F, 202A–202E, 2066–2069), birleşen işaretler ve C0/C1 kontrol karakterleri — bunlar bir nokta olarak gösterilir, böylece görünmez içerik görünür hale gelir. Bir özet satırı, kod noktası sayısını, UTF-16 uzunluğunu (String.length) ve toplam UTF-8 bayt sayısını bildirir. Bu araç inceleme içindir; NFC ve NFD arasında normalleştirmek için Unicode normalleştiriciyi kullanın. Tam dökümü sekmeyle ayrılmış metin olarak kopyalayın.

Sık sorulan sorular

Bir emoji neden bir giriş olarak sayılır ama uzunluğu 2?
Birçok emoji ve U+FFFF üzerindeki tüm karakterler, UTF-16'da bir vekil çifti olarak kodlanmış tek kod noktalarıdır — iki 16-bit birim. İnceleyici kod noktasına göre yineler, bu yüzden bir satır gösterir, JavaScript'in String.length'i ise özetin ayrı olarak bildirdiği iki birimi sayar.
UTF-8 ve UTF-16 baytları nasıl türetilir?
Doğrudan kod noktasından hesaplanırlar: UTF-8 standart 1–4 bayt kurallarını kullanır ve UTF-16, BMP karakterleri için tek bir birim veya astral olanlar için bir yüksek+düşük vekil çiftidir (D800–DBFF ardından DC00–DFFF). Yüzde kodlaması, basitçe o UTF-8 baytlarının %XX olarak yazılmasıdır.
Bayraklar ne anlama gelir?
Gözden kaçması kolay karakterleri vurgularlar: sıfır genişlik (200B–200D, 2060, FEFF), metni yeniden sıralayabilen çift yönlü kontroller, önceki bir harfe eklenen birleşen işaretler ve kontrol karakterleri. Bu tür karakterler bir orta nokta olarak görüntülenir, böylece gizli veya görünmez içerik ortaya çıkarılır.
Resmi Unicode karakter adını gösterir mi?
İyi bilinen karakterleri (kontrol kodları, boşluklar, sıfır genişlik ve bidi kontrolleri) adlandırır ve her zaman her kod noktası için Unicode bloğunu ve genel kategoriyi gösterir. Unicode veritabanından tam karakter başına adlar paketlenmemiştir, bu yüzden aksi takdirde blok adı tanımlayıcı olarak hizmet eder.

Daha fazla araç