Sprawdzanie robots.txt
Wklej swoje reguły robots.txt i ścieżkę URL, którą chcesz przetestować, a narzędzie odczyta wiersze Allow i Disallow, aby powiedzieć, czy ta ścieżka zostanie zablokowana czy dozwolona. Przydatne, gdy strona nagle znika z Google i chcesz potwierdzić, czy przyczyną jest zbyt restrykcyjna reguła Disallow, albo gdy tworzysz nowe reguły i chcesz sprawdzić ścieżkę przed opublikowaniem pliku.
Jak działa narzędzie
-
1
Wklej swoje reguły
Skopiuj wiersze Allow i Disallow ze swojego robots.txt do pola albo napisz nowe, aby je przetestować.
-
2
Wpisz ścieżkę do przetestowania
Wpisz ścieżkę URL, którą chcesz sprawdzić, na przykład /private/page. Użyj samej ścieżki, a nie pełnej domeny.
-
3
Sprawdź regułę
Narzędzie przeszukuje wiersze Allow i Disallow i znajduje regułę pasującą do wpisanej ścieżki.
-
4
Odczytaj wynik
Otrzymujesz liczbę znalezionych reguł, przetestowaną ścieżkę oraz decyzję: dozwolone domyślnie, zablokowane przez Disallow lub dozwolone przez Allow.
Minimalny poprawny plik robots.txt
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
- User-agent: *. Dotyczy każdego robota, który nie został wyraźnie wymieniony w innym bloku.
- Allow: /. Domyślnie wszystko jest dozwolone.
- Disallow: /admin/. Katalog administracyjny jest niedostępny.
- Sitemap:. Informuje wyszukiwarki, gdzie znajduje się mapa witryny XML.
Reguły, których Googlebot faktycznie przestrzega
Parser Google jest de facto standardem interpretacji niejednoznacznych reguł:
- Ścieżki rozróżniają wielkość liter.
/Admin/i/admin/to różne ścieżki. - Wygrywa najdłuższe dopasowanie.
Allow: /admin/public/ma pierwszeństwo przedDisallow: /admin/dla adresu URL zaczynającego się od/admin/public/. - Symbole wieloznaczne.
*pasuje do dowolnego ciągu znaków;$zakotwicza dopasowanie na końcu adresu URL. - Komentarze zaczynają się od
#. - Niezależne od kolejności. Reguły są oceniane według specyficzności (długości ścieżki), a nie według kolejności w pliku.
Najczęstsze błędy
| Błąd | Skutek |
|---|---|
Disallow: / na górze, bez Allow |
Cała witryna zablokowana |
Disallow: *.pdf |
Wiele parserów to ignoruje, użyj Disallow: /*.pdf$ |
| Adres względny wobec protokołu lub bezwzględny w Disallow | Ignorowany, ścieżki muszą być względne |
Kilka wierszy User-agent przed regułami |
Łączone; reguły dotyczą wszystkich wymienionych UA |
| Spacje na końcu ścieżek | Po cichu traktowane jako inna ścieżka |
| Umieszczenie robots.txt w podkatalogu | Pobierany jest tylko plik z domeny głównej |
robots.txt a noindex
robots.txt każe robotom nie pobierać adresu URL. Strona, która została już zaindeksowana, a następnie zablokowana w robots.txt, może pozostać w indeksie przez miesiące, robot nie może jej pobrać, aby potwierdzić usunięcie. Jeśli chcesz ją usunąć z indeksu, użyj metatagu noindex lub nagłówka HTTP na samej stronie i pozwól robotowi go zobaczyć.
Crawl-delay
Crawl-delay: 10 prosi o 10 sekund przerwy między żądaniami. Google to ignoruje (częstotliwość indeksowania ustawisz w Search Console). Bing, Yandex i niektóre niszowe roboty go przestrzegają. Używaj go w małych witrynach obciążonych przez niszowe boty.
Czego Disallow NIE robi
- Nie blokuje możliwości linkowania. Inne strony nadal mogą linkować do zablokowanego adresu URL, a ten pojawi się w wynikach wyszukiwania jako sam adres (bez tytułu i opisu).
- Nie zapobiega wyświetleniu strony. Użytkownicy nadal mogą odwiedzić adres URL objęty regułą Disallow.
- Nie ukrywa adresu URL przed światem. robots.txt jest publiczny; wypisywanie w nim tajnych ścieżek tylko je ujawnia.
Najczęściej zadawane pytania
Ponieważ Disallow blokuje indeksowanie (crawling), a nie umieszczanie w indeksie. Jeśli Google już zna adres URL (z linków lub mapy witryny), może zachować sam adres w wynikach wyszukiwania. Dodaj na stronie tag noindex i pozwól Google ją pobrać, aby potwierdzić usunięcie.
Tak. Użyj bloku User-agent: BadBot z własnymi regułami. Pamiętaj, że źle zachowujące się boty całkowicie ignorują robots.txt; przestrzegają go tylko boty działające zgodnie z zasadami.
Nie. robots.txt jest publiczny, wypisanie go ujawnia lokalizację. Zamiast tego użyj uwierzytelniania i kontroli dostępu na poziomie serwera.
Tak, w przypadku ścieżek. Disallow: /Admin/ nie blokuje /admin/. Dopasuj rzeczywistą wielkość liter swoich adresów URL.
Tak. Wypisz kilka wierszy Sitemap:, aby wskazać osobne mapy witryny XML lub indeks map witryny.
Powiązane narzędzia
Sprawdzacz indeksowalności
Sprawdź, czy adres URL może zostać indeksowany: plik robots.txt, metaparametry robots, tag X-Robots, sygnały kanoniczne oraz stan HTTP.
Ekstraktor linków zewnętrznych
Wklej surowy kod HTML, opcjonalnie podaj adres URL podstawowy i otrzymaj czystą, bez duplikatów listę wszystkich zewnętrznych linków http/https w kodzie, na potrzeby audytów linków i analiz SEO.
Sprawdzanie długości meta opisu
Zmierz meta opis w znakach i szacowanych pikselach, porównaj wskazówki redakcyjne i przejrzyj makiety na komputer i telefon.
Sprawdzanie URL canonical
Wklej HTML strony i sprawdź jej tag rel=canonical: czy jest obecny, czy jest poprawnym absolutnym URL-em, czy zgadza się z URL-em strony?
Walidator hreflang
Sprawdź lokalnie adnotacje hreflang we wklejonym HTML: kody, pełne adresy, duplikaty, położenie i autoreferencję.
Generator schematu FAQ
Wygeneruj znaczniki JSON-LD FAQPage z par pytań i odpowiedzi, aby Twoja strona kwalifikowała się do wyników z elementami rozszerzonymi i do ramki z odpowiedzią w Google.
Narzędzie jest dostępne w innych językach
- Robots.txt-checker [NL]
- Vérificateur de Robots.txt [FR]
- أداة فحص ملف robots.txt [AR]
- Pemeriksa Robot.txt [ID]
- Robots.txt-Prüfer [DE]
- Verificador de robots.txt [ES]
- เครื่องมือตรวจสอบไฟล์ robots.txt [TH]
- Robots.txtチェッカー [JA]
- Robots.txt-kontroll [SV]
- Trình kiểm tra robots.txt [VI]
- Robots.txt 검사기 [KO]
- Verificador de Robots.txt [PT]
- Проверка robots.txt [RU]
- Robots.txt Denetleyici [TR]
- Robots.txt 检查器 [ZH]
- Robots.txt Checker [EN]
- Controllore Robots.txt [IT]