Wydobywanie URL-ów z tekstu

Wklej protokół rozmowy, dokument w formacie Markdown, wątek e-mailowy lub surowy plik HTML, a otrzymasz czystą listę wszystkich linków http:// i https://, które zawiera. Narzędzie usuwa końcowe znaki interpunkcyjne, obsługuje składnię linków Markdown i HTML oraz eliminuje identyczne duplikaty, dzięki czemu listę można od razu przekazać do crawlera lub narzędzia archiwizującego.

Jak wyodrębnić adresy URL

  1. 1

    Wklej źródło

    Wpisz tekst lub kod HTML. Cudzysłowy, nawiasy kątowe, składnia linków Markdown i końcowe znaki interpunkcyjne są obsługiwane automatycznie.

  2. 2

    Uruchom skanowanie

    Znajdowane są wszystkie linki `http://` i `https://`, usuwane końcowe znaki interpunkcyjne i eliminowane identyczne duplikaty.

  3. 3

    Sprawdź liczbę

    Zobaczysz, ile unikalnych adresów URL znaleziono, oraz pełną listę.

  4. 4

    Kopiuj lub eksportuj

    Jeden adres URL w wierszu, gotowy do użycia z `curl -I`, archiwizatorem, usługą zrzutów ekranu lub listami startowymi Screaming Frog.

Co uznajemy za adres URL

Wykrywanie adresów URL jest trudniejsze, niż się wydaje, dlatego to narzędzie celowo trzyma się jednej bezpiecznej zasady: rozpoznaje wyłącznie pełne linki http:// i https://. Cała reszta zostaje w tekście.

Rozpoznawane formy

Forma Przykład
Bezwzględny HTTPS https://example.com/path?q=1
Bezwzględny HTTP http://example.com
Cel linku Markdown [text](https://example.com)
Bezwzględny href w HTML href="https://example.com"

Zasady obcinania

Końcowe znaki interpunkcyjne są usuwane, więc (https://example.com). staje się https://example.com. Spacje, cudzysłowy, nawiasy kątowe, okrągłe, kwadratowe, przecinki i średniki kończą dopasowanie. Adres URL zawierający nawiasy jest przycinany przy pierwszym nawiasie otwierającym, więc tytuł w stylu Wikipedii jest wyodrębniany tylko do nawiasu otwierającego.

Co jest pomijane

  • mailto:, tel:, ftp: oraz każdy inny schemat niż http lub https.
  • Linki względne wobec protokołu, takie jak //cdn.example.com/asset.js.
  • Gołe domeny i adresy z prefiksem www. bez schematu, np. example.com/docs/intro lub www.example.com/page.
  • Same kotwice, takie jak #section, i pseudo-adresy URL w JavaScripcie.

Jak traktowane są duplikaty

Identyczne duplikaty są usuwane: https://example.com liczy się raz, niezależnie od liczby wystąpień, a Example.com i example.com pozostają osobnymi pozycjami. Lista zachowuje kolejność pierwszego wystąpienia każdego adresu URL.

Wskazówki dotyczące dalszego przetwarzania

  • Zamień na małe litery, aby uzyskać deduplikację kanoniczną. Jeśli Example.com i example.com mają liczyć się jako jeden host, zamień wynik na małe litery i ponownie usuń duplikaty.
  • Usuwaj parametry śledzenia narzędziem czyszczącym UTM przed archiwizacją, w przeciwnym razie otrzymasz dziesiątki niemal identycznych duplikatów.
  • Sprawdzaj status. Przepuść listę przez sprawdzarkę uszkodzonych linków, aby usunąć błędy 404 przed jej zatwierdzeniem.

Najczęściej zadawane pytania

Tylko wtedy, gdy krótki link jest zapisany z pełnym schematem. Sam bit.ly/xyz nie zostanie wyodrębniony, ale https://bit.ly/xyz jest traktowany jak zwykły adres URL. Narzędzie nie podąża za przekierowaniami; rozwiąż je osobno, jeśli potrzebujesz docelowego adresu.

Tak, gdy href jest pełnym adresem http:// lub https://. Wartość jest wyodrębniana czysto, bez otaczającego taga; względne href nie są pobierane.

Są zachowywane dosłownie. Jeśli chcesz usunąć utm_* i podobne parametry śledzenia, użyj po wyodrębnieniu narzędzia do czyszczenia adresów URL.

Nie. Tekst jest przetwarzany w trakcie żądania, a jego treść nie jest zapisywana ani rejestrowana.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach