UTILS.
100% 브라우저 내 실행
🔤

유니코드 문자 검사기

임의의 문자열을 코드 포인트로 분해하여 각각의 U+ hex, 카테고리, 블록, UTF-8/UTF-16 바이트, HTML 엔티티, JS 이스케이프, 퍼센트 인코딩, 플래그를 표시합니다.

위에 텍스트를 입력하여 각 문자를 검사하세요.

이 도구에 대하여

유니코드 문자 검사기는 문자열을 개별 코드 포인트로 나누어 각각에 대한 모든 것을 표시합니다. 16비트 유닛이 아니라 코드 포인트 단위로 순회하므로, 서로게이트 쌍으로 이루어진 아스트랄 문자와 이모지가 올바르게 처리됩니다. 모든 코드 포인트에 대해 글리프, U+XXXX hex 값, 10진수 값, 잘 알려진 문자의 이름, 일반 카테고리, 그리고 속한 유니코드 블록을 얻습니다.

모든 분석은 브라우저에서 알고리즘적으로 도출되며 아무것도 업로드되지 않습니다. 인코딩은 원리에서부터 계산됩니다. UTF-8 바이트는 1~4바이트 인코딩 규칙을 따르고, UTF-16 코드 유닛은 BMP에서는 단일 유닛이거나 그 위에서는 상위/하위 서로게이트 쌍(D800–DBFF / DC00–DFFF)이며, HTML 숫자 엔티티는 &#nnnn;이고, JavaScript 이스케이프는 BMP의 경우 \uXXXX이거나 아스트랄 코드 포인트의 경우 \u{XXXXX}이며, 퍼센트 인코딩은 UTF-8 바이트를 %XX로 쓴 것입니다. 일반 카테고리(Lu, Ll, Nd, Mn, Zs, Cc 등)는 유니코드 속성 이스케이프 정규식으로 감지됩니다.

검사기는 종종 버그를 일으키거나 텍스트를 숨기는 데 사용되는 문자를 표시합니다: 폭이 0인 문자(200B–200D, 2060, FEFF), 양방향 제어(200E, 200F, 202A–202E, 2066–2069), 결합 표시, C0/C1 제어 문자 — 이들은 점으로 표시되어 보이지 않는 내용이 보이게 됩니다. 요약 줄은 코드 포인트 수, UTF-16 길이(String.length), 총 UTF-8 바이트 수를 보고합니다. 이 도구는 검사용입니다. NFC와 NFD 사이에서 정규화하려면 유니코드 정규화 도구를 사용하세요. 전체 분해를 탭으로 구분된 텍스트로 복사하세요.

자주 묻는 질문

왜 이모지가 항목 하나로 세는데 길이는 2인가요?
많은 이모지와 U+FFFF 이상의 모든 문자는 UTF-16에서 서로게이트 쌍 — 두 개의 16비트 유닛 — 으로 인코딩된 단일 코드 포인트입니다. 검사기는 코드 포인트 단위로 순회하므로 한 줄을 표시하는 반면, JavaScript의 String.length는 두 유닛을 세며, 요약에서 이를 따로 보고합니다.
UTF-8과 UTF-16 바이트는 어떻게 도출되나요?
코드 포인트에서 직접 계산됩니다. UTF-8은 표준 1~4바이트 규칙을 사용하고, UTF-16은 BMP 문자에는 한 유닛이거나 아스트랄 문자에는 상위+하위 서로게이트 쌍(D800–DBFF 다음 DC00–DFFF)입니다. 퍼센트 인코딩은 단순히 그 UTF-8 바이트를 %XX로 쓴 것입니다.
플래그는 무엇을 의미하나요?
놓치기 쉬운 문자를 강조합니다: 폭이 0인 문자(200B–200D, 2060, FEFF), 텍스트를 재정렬할 수 있는 양방향 제어, 앞 글자에 붙는 결합 표시, 그리고 제어 문자입니다. 이런 문자는 가운뎃점으로 표시되어 숨겨졌거나 보이지 않는 내용이 드러납니다.
공식 유니코드 문자 이름을 표시하나요?
잘 알려진 문자(제어 코드, 공백, 폭이 0인 문자와 양방향 제어)의 이름을 표시하고, 모든 코드 포인트에 대해 항상 유니코드 블록과 일반 카테고리를 표시합니다. 유니코드 데이터베이스의 전체 문자별 이름은 포함되어 있지 않으므로, 그 외의 경우 블록 이름이 설명자 역할을 합니다.

더 많은 도구