Wyszukiwarka Unicode

Wrzuć tajemniczy znak, dziwny biały znak, który wkleił twój użytkownik, glif z podglądu czcionki, emoji psujące twoje wyrażenie regularne, a wyszukiwarka zwróci jego punkt kodowy Unicode (U+XXXX) i surowe bajty UTF-8 w zapisie szesnastkowym, po jednym wierszu na znak.

Jak zidentyfikować znak Unicode

  1. 1

    Wklej znak

    Możesz wkleić jeden glif albo cały ciąg: każdy znak jest analizowany po kolei.

  2. 2

    Odczytaj punkt kodowy

    Otrzymaj kanoniczną notację U+ wielkimi literami, dopełnioną zerami do co najmniej czterech cyfr szesnastkowych.

  3. 3

    Sprawdź bajty UTF-8

    Zobacz sekwencję 1–4 bajtów, którą znak zajmuje na dysku albo w transmisji.

  4. 4

    Skopiuj wyniki

    Wynik to tabela w formacie CSV (znak, punkt kodowy, bajty UTF-8), którą możesz zaznaczyć i wkleić do arkusza kalkulacyjnego albo zgłoszenia błędu.

Typowa robota detektywistyczna z wyszukiwarką

Większość błędów Unicode wygląda na ekranie identycznie. Jedyny sposób, by odróżnić zwykłą spację od spacji niełamiącej albo apostrof drukarski od primy, to sprawdzić punkt kodowy.

Częste pułapki, które rozwiązuje wyszukiwarka

Wygląda jak Naprawdę jest Punkt kodowy
Spacja Spacja niełamiąca U+00A0
Spacja Wąska spacja niełamiąca U+202F
(nic) Spacja zerowej szerokości U+200B
(nic) Znacznik łączący zerowej szerokości U+200D
Apostrof Prawy pojedynczy cudzysłów U+2019
Apostrof Prima (stopy/minuty) U+2032
Łącznik Półpauza U+2013
Łącznik Łącznik niełamiący U+2011

Układ bajtów UTF-8 w skrócie

  • 1 bajt, ASCII, U+0000 do U+007F (0xxxxxxx)
  • 2 bajty, dodatek łaciński, arabski, hebrajski (110xxxxx 10xxxxxx)
  • 3 bajty, CJK, większość symboli (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 bajty, emoji, rzadkie pisma (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Jeśli twoja kolumna bazy danych ma stałą długość w bajtach, 4-bajtowe emoji zje cztery miejsca, mimo że renderuje się jako jeden glif, częste źródło błędów obcinania.

Najczęściej zadawane pytania

Zwykle znaczniki BOM (U+FEFF) na początku pliku albo zbłąkane znaczniki łączące zerowej szerokości z edytora tekstu. Wklej jeden do wyszukiwarki, a od razu ci powie, a potem możesz je usunąć prostym znajdź-i-zamień.

Tak. Wyszukiwarka iteruje znak po znaku, więc całe słowo daje jeden wiersz na znak z jego punktem kodowym i bajtami UTF-8.

Punkt kodowy to abstrakcyjna tożsamość znaku, U+00E9 to zawsze „é” niezależnie od tego, gdzie go przechowasz. UTF-8 to jedno z kilku kodowań zamieniających punkt kodowy na bajty; to samo „é” to dwa bajty C3 A9 w UTF-8, ale pojedynczy bajt E9 w Latin-1.

Tak. Wyszukiwanie odbywa się na naszym serwerze: wklejone znaki są wysyłane, analizowane, a ich punkt kodowy i bajty UTF-8 są zwracane natychmiast. Nie przechowujemy przesłanego tekstu.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach