Konwerter HTML do tekstu

E-maile w formacie zwykłego tekstu, analiza tekstu oraz procesy liczenia słów wymagają zamiany kodu HTML na czytelny ciąg, który człowiek widzi na ekranie, bez pozostałości znaczników. Wklej HTML, a to narzędzie usunie wszystkie tagi, zdekoduje encje (&&), scali ciągi białych znaków powstałe z wcięć i wygeneruje czysty, czytelny blok tekstu gotowy do analizy lub do wykorzystania jako część text/plain wiadomości wieloczęściowej.

Jak wyodrębnić tekst z kodu HTML

  1. 1

    Wklej HTML

    Dowolnej wielkości, fragment, sformatowana treść e-maila lub cała strona.

  2. 2

    Konwertuj

    Jedno kliknięcie: wszystkie tagi i atrybuty są usuwane, a encje dekodowane.

  3. 3

    Sprawdź podziały wierszy

    Akapity, elementy list i wiersze tabel stają się oddzielnymi liniami, dzięki czemu tekst zachowuje strukturę.

  4. 4

    Skopiuj tekst

    Wynik to czysty tekst w kodowaniu Unicode, który można bezpiecznie przekazać do licznika słów, szablonu e-maila lub modelu analizy sentymentu.

W jaki sposób konwersja przetwarza skomplikowane tagi

Zamiana HTML na tekst to coś więcej niż string.replace(/<[^>]+>/, ""); naiwne wyrażenie regularne pozostawia kody encji i spacje z wcięć oraz nie wie, że </p> powinno rozpocząć nową linię.

Tagi blokowe a tagi liniowe

Tagi blokowe (<br>, oraz tagi zamykające </p>, </div>, </h1> do </h6>, </li>, </tr>) powodują po jednym podziale wiersza. Tagi liniowe (<a>, <span>, <strong>) nie pozostawiają odstępu, dzięki czemu słowa się nie zlepiają.

Zachowanie poszczególnych tagów

Tag Przetwarzanie
<br> Jeden podział wiersza
</p>, </div>, </h1> do </h6> Jeden podział wiersza na każdy tag zamykający
</li>, </tr> Jeden podział wiersza; nie są dodawane punktory ani separatory komórek tabeli
<a href="url">text</a> text; atrybut href jest usuwany
<img alt="text"> Nic, tag nie ma widocznego tekstu
<script>, <style> Tagi są usuwane, tekst między nimi pozostaje

Dekodowanie encji

  • Encje nazwane (&amp;, &copy;, &eacute;) są dekodowane na odpowiadające im znaki Unicode.
  • Encje numeryczne (&#169;, &#x00A9;) również są dekodowane.
  • Nieznane encje są zachowywane dosłownie, aby narzędzia analityczne mogły je zobaczyć.

Normalizacja białych znaków

  • Spacje i tabulatory przed podziałem wiersza są usuwane.
  • Trzy lub więcej pustych wierszy jest redukowanych do jednego.
  • Spacje między słowami pozostają bez zmian; konwerter nie przeformatowuje tekstu.

Zastosowania

  • Generowanie części text/plain wiadomości wieloczęściowej.
  • Czyszczenie zeskrapowanych artykułów przed przekazaniem ich do modelu językowego.
  • Zasilanie indeksu wyszukiwania zwykłym tekstem.
  • Obliczanie rzetelnej liczby słów z pominięciem znaczników.

Najczęściej zadawane pytania

Formatowanie wizualne (pogrubienie, kolor, czcionka) zostaje utracone, i o to właśnie chodzi. Struktura zostaje zachowana jako podziały wierszy: akapity, elementy list i wiersze tabel stają się oddzielnymi liniami, dzięki czemu tekst pozostaje czytelny.

Widoczny tekst linku zostaje, ale adres URL jest usuwany razem z atrybutami tagu. Jeśli potrzebujesz adresów URL, użyj dedykowanego konwertera HTML do Markdown.

Konwerter usuwa same tagi, ale zachowuje tekst między nimi, więc zawartość bloków <script> i <style> pozostaje w wyniku. Usuń ją najpierw z kodu źródłowego HTML, jeśli jej nie chcesz.

Tak. Wynik jest w kodowaniu UTF-8 i zachowuje wszystkie znaki spoza zestawu ASCII z danych wejściowych. Encje takie jak &copy; i &eacute; są dekodowane na odpowiadające im znaki Unicode.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach