Usuwanie znaków diakrytycznych

Slugi w adresach URL, nazwy plików na serwerach FTP oraz stare bazy danych z kodowaniem Latin-1: wszystko to działa nieprawidłowo, gdy podasz im nazwę w rodzaju „José Peña“ lub „Zoë“. To narzędzie usuwa z tekstu akcenty, tyldy, umlauty i cedille za pomocą standardowej transliteracji i normalizacji Unicode, pozostawiając czysty tekst ASCII, który bez problemu przejdzie przez każdy potok przetwarzania danych.

Jak usunąć znaki diakrytyczne

  1. 1

    Wklej swój tekst

    Wpisz lub wklej dowolny tekst zawierający znaki akcentowane: słowo, listę imion lub cały artykuł.

  2. 2

    Uruchom konwersję

    Kliknij „Usuń znaki diakrytyczne". Każda litera z akcentem staje się zwykłym ASCII: é na e, ñ na n, ß na ss.

  3. 3

    Sprawdź oczyszczony wynik

    Spójrz na pole wyniku: każdy zmieniony znak jest teraz zwykłym ASCII, a spacje, interpunkcja i końce linii pozostają bez zmian.

  4. 4

    Skopiuj wynik

    Skopiuj oczyszczony tekst do schowka jednym kliknięciem i wklej go tam, gdzie go potrzebujesz.

Jak działa usuwanie

Narzędzie najpierw używa transliteracji ICU (reguła „Any-Latin; Latin-ASCII“): zamienia tekst na znaki łacińskie, a następnie usuwa pozostałe akcenty, więc é staje się e, ß ss, a æ ae. Gdy silnik transliteracji jest niedostępny, narzędzie przechodzi na Unicode NFD (forma normalizacji przez kanoniczne rozłożenie), która dzieli é na literę bazową e (U+0065) i łączący akcent ostry (U+0301), usuwa wszystkie punkty kodowe z zakresu znaków łączących (U+0300–U+036F), a następnie składa tekst ponownie. Obie ścieżki działają dla każdego języka, który używa alfabetu łacińskiego z dodatkowymi znakami.

Tabela zamiany znaków

Wejście Wynik
á é í ó ú a e i o u
à è ì ò ù a e i o u
â ê î ô û a e i o u
ä ë ï ö ü a e i o u
ñ n
ç c
ß ss
æ Æ ae AE
œ Œ oe OE
ø Ø o O
ł Ł l L

Ścieżka zapasowa (bez transliteracji) pozostawia ß, æ, œ, ø i ł bez zmian, ponieważ usuwa wyłącznie znaki łączące.

Zastosowania

  • Slugi URL. „El niño“ staje się „el-nino“ po usunięciu znaków i zamianie na małe litery.
  • Nazwy plików. Usługi przechowywania w chmurze i niektóre starsze serwery FTP uszkadzają nazwy plików spoza ASCII; najpierw usuń znaki, potem wgrywaj.
  • Importy CSV do starszych systemów. Każda baza danych z kodowaniem Latin-1 (Windows-1252) będzie błędnie traktować wielobajtowe znaki UTF-8; usunięcie znaków zapobiega uszkodzeniu danych.
  • Pola wyszukiwalne. Przechowywanie wersji bez znaków diakrytycznych obok oryginału pozwala użytkownikom znaleźć „naive“, nawet gdy w wierszu zapisano „naïve“.

Uwaga: to podróż w jedną stronę

Usunięcie znaków z „naïve“ daje „naive“; nie możesz automatycznie odzyskać umlautu, ponieważ informacja o języku zostaje utracona. Gdy obie wersje mogą być potrzebne, zachowaj oryginał obok oczyszczonej wersji.

Najczęściej zadawane pytania

To nie są diakrytyki, lecz odrębne litery bez prostego znaku łączącego. Narzędzie i tak je zamienia: ß na ss, æ na ae, œ na oe, ø na o, a ł na l. Ścieżka zapasowa, używana tylko wtedy, gdy silnik transliteracji jest niedostępny, pozostawia je bez zmian.

Domyślna ścieżka transliteruje również te pisma: tekst cyrylicki, grecki, arabski i CJK staje się znakami łacińskimi (Привет to Privet, Ελλάδα to Ellada, 你好 to ni hao), a następnie pozostałe znaki są usuwane. Ścieżka zapasowa usuwa tylko znaki łączące i pozostawia pisma niełacińskie bez zmian.

Tak. Akcentowane wielkie litery stają się wielkimi literami ASCII, małe pozostają małe. Spacje, interpunkcja i końce wierszy pozostają bez zmian.

Twój tekst jest wysyłany na nasz serwer wyłącznie w celu wykonania konwersji; nie jest przechowywany po przetworzeniu ani dodawany do linku strony. Zbieramy wyłącznie anonimowe statystyki użycia.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach