Wydobywanie URL-ów z tekstu
Wklej protokół rozmowy, dokument w formacie Markdown, wątek e-mailowy lub surowy plik HTML, a otrzymasz czystą listę wszystkich linków http:// i https://, które zawiera. Narzędzie usuwa końcowe znaki interpunkcyjne, obsługuje składnię linków Markdown i HTML oraz eliminuje identyczne duplikaty, dzięki czemu listę można od razu przekazać do crawlera lub narzędzia archiwizującego.
Jak wyodrębnić adresy URL
-
1
Wklej źródło
Wpisz tekst lub kod HTML. Cudzysłowy, nawiasy kątowe, składnia linków Markdown i końcowe znaki interpunkcyjne są obsługiwane automatycznie.
-
2
Uruchom skanowanie
Znajdowane są wszystkie linki `http://` i `https://`, usuwane końcowe znaki interpunkcyjne i eliminowane identyczne duplikaty.
-
3
Sprawdź liczbę
Zobaczysz, ile unikalnych adresów URL znaleziono, oraz pełną listę.
-
4
Kopiuj lub eksportuj
Jeden adres URL w wierszu, gotowy do użycia z `curl -I`, archiwizatorem, usługą zrzutów ekranu lub listami startowymi Screaming Frog.
Co uznajemy za adres URL
Wykrywanie adresów URL jest trudniejsze, niż się wydaje, dlatego to narzędzie celowo trzyma się jednej bezpiecznej zasady: rozpoznaje wyłącznie pełne linki http:// i https://. Cała reszta zostaje w tekście.
Rozpoznawane formy
| Forma | Przykład |
|---|---|
| Bezwzględny HTTPS | https://example.com/path?q=1 |
| Bezwzględny HTTP | http://example.com |
| Cel linku Markdown | [text](https://example.com) |
| Bezwzględny href w HTML | href="https://example.com" |
Zasady obcinania
Końcowe znaki interpunkcyjne są usuwane, więc (https://example.com). staje się https://example.com. Spacje, cudzysłowy, nawiasy kątowe, okrągłe, kwadratowe, przecinki i średniki kończą dopasowanie. Adres URL zawierający nawiasy jest przycinany przy pierwszym nawiasie otwierającym, więc tytuł w stylu Wikipedii jest wyodrębniany tylko do nawiasu otwierającego.
Co jest pomijane
mailto:,tel:,ftp:oraz każdy inny schemat niżhttplubhttps.- Linki względne wobec protokołu, takie jak
//cdn.example.com/asset.js. - Gołe domeny i adresy z prefiksem
www.bez schematu, np.example.com/docs/introlubwww.example.com/page. - Same kotwice, takie jak
#section, i pseudo-adresy URL w JavaScripcie.
Jak traktowane są duplikaty
Identyczne duplikaty są usuwane: https://example.com liczy się raz, niezależnie od liczby wystąpień, a Example.com i example.com pozostają osobnymi pozycjami. Lista zachowuje kolejność pierwszego wystąpienia każdego adresu URL.
Wskazówki dotyczące dalszego przetwarzania
- Zamień na małe litery, aby uzyskać deduplikację kanoniczną. Jeśli
Example.comiexample.commają liczyć się jako jeden host, zamień wynik na małe litery i ponownie usuń duplikaty. - Usuwaj parametry śledzenia narzędziem czyszczącym UTM przed archiwizacją, w przeciwnym razie otrzymasz dziesiątki niemal identycznych duplikatów.
- Sprawdzaj status. Przepuść listę przez sprawdzarkę uszkodzonych linków, aby usunąć błędy 404 przed jej zatwierdzeniem.
Najczęściej zadawane pytania
Tylko wtedy, gdy krótki link jest zapisany z pełnym schematem. Sam bit.ly/xyz nie zostanie wyodrębniony, ale https://bit.ly/xyz jest traktowany jak zwykły adres URL. Narzędzie nie podąża za przekierowaniami; rozwiąż je osobno, jeśli potrzebujesz docelowego adresu.
Tak, gdy href jest pełnym adresem http:// lub https://. Wartość jest wyodrębniana czysto, bez otaczającego taga; względne href nie są pobierane.
Są zachowywane dosłownie. Jeśli chcesz usunąć utm_* i podobne parametry śledzenia, użyj po wyodrębnieniu narzędzia do czyszczenia adresów URL.
Nie. Tekst jest przetwarzany w trakcie żądania, a jego treść nie jest zapisywana ani rejestrowana.
Powiązane narzędzia
Licznik słów
Policz słowa, znaki, zdania i akapity wraz z czasem czytania, czasem mówienia, gęstością słów kluczowych i wskaźnikiem czytelności Flescha, dla wypracowań, postów, podpisów i meta opisów.
Generator nazw miast
Generuj fikcyjne nazwy miast, miasteczek, wsi i stolic do worldbuildingu, map, gier, opowieści i danych testowych, z krótkimi notatkami do każdego wyniku.
Symbol „mniejsze lub równe"
Skopiuj znak ≤ oraz powiązane matematyczne symbole porównania. Obejmuje Unicode, encje HTML i zapis LaTeX do arkuszy kalkulacyjnych, prac naukowych i stron internetowych.
Symbole strzałek do skopiowania
Kopiuj popularne strzałki Unicode jednym kliknięciem: proste, podwójne, ukośne, zawinięte, okrężne i trójkątne do dokumentów, czatu i projektów.
Konwerter tekstu przyjaznego dyslektykom
Przeformatuj wklejony tekst na krótkie akapity i linie o około 72 znakach, aby łatwiej się czytało. Skopiuj wynik do dowolnego dokumentu, e-maila lub edytora.
Generator nazw domenowych
Generuj pomysły na nazwy domenowe z jednego słowa kluczowego: prefiksy, sufiksy, podwojone litery i końcówki cyfrowe w sześciu popularnych TLD.
Narzędzie jest dostępne w innych językach
- Extraire des URL du texte [FR]
- Extrahera URL:er från text [SV]
- Extrair URLs do Texto [PT]
- Metinden URL'leri Çıkarma [TR]
- استخراج عناوين URL من النص [AR]
- 텍스트에서 URL을 추출합니다 [KO]
- テキストからURL抽出 [JA]
- URL's extraheren uit tekst [NL]
- ดึง URL จากข้อความ [TH]
- Extract URLs from Text [EN]
- 从文本中提取 URL [ZH]
- Extraer URLs del Texto [ES]
- Ekstrak URL dari Teks [ID]
- Trích xuất URL từ văn bản [VI]
- URLs aus Text extrahieren [DE]
- Estrai URL dal testo [IT]
- Извлечение URL из текста [RU]