Sprawdzanie robots.txt

Wklej swoje reguły robots.txt i ścieżkę URL, którą chcesz przetestować, a narzędzie odczyta wiersze Allow i Disallow, aby powiedzieć, czy ta ścieżka zostanie zablokowana czy dozwolona. Przydatne, gdy strona nagle znika z Google i chcesz potwierdzić, czy przyczyną jest zbyt restrykcyjna reguła Disallow, albo gdy tworzysz nowe reguły i chcesz sprawdzić ścieżkę przed opublikowaniem pliku.

Jak działa narzędzie

  1. 1

    Wklej swoje reguły

    Skopiuj wiersze Allow i Disallow ze swojego robots.txt do pola albo napisz nowe, aby je przetestować.

  2. 2

    Wpisz ścieżkę do przetestowania

    Wpisz ścieżkę URL, którą chcesz sprawdzić, na przykład /private/page. Użyj samej ścieżki, a nie pełnej domeny.

  3. 3

    Sprawdź regułę

    Narzędzie przeszukuje wiersze Allow i Disallow i znajduje regułę pasującą do wpisanej ścieżki.

  4. 4

    Odczytaj wynik

    Otrzymujesz liczbę znalezionych reguł, przetestowaną ścieżkę oraz decyzję: dozwolone domyślnie, zablokowane przez Disallow lub dozwolone przez Allow.

Minimalny poprawny plik robots.txt

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
  • User-agent: *. Dotyczy każdego robota, który nie został wyraźnie wymieniony w innym bloku.
  • Allow: /. Domyślnie wszystko jest dozwolone.
  • Disallow: /admin/. Katalog administracyjny jest niedostępny.
  • Sitemap:. Informuje wyszukiwarki, gdzie znajduje się mapa witryny XML.

Reguły, których Googlebot faktycznie przestrzega

Parser Google jest de facto standardem interpretacji niejednoznacznych reguł:

  • Ścieżki rozróżniają wielkość liter. /Admin/ i /admin/ to różne ścieżki.
  • Wygrywa najdłuższe dopasowanie. Allow: /admin/public/ ma pierwszeństwo przed Disallow: /admin/ dla adresu URL zaczynającego się od /admin/public/.
  • Symbole wieloznaczne. * pasuje do dowolnego ciągu znaków; $ zakotwicza dopasowanie na końcu adresu URL.
  • Komentarze zaczynają się od #.
  • Niezależne od kolejności. Reguły są oceniane według specyficzności (długości ścieżki), a nie według kolejności w pliku.

Najczęstsze błędy

Błąd Skutek
Disallow: / na górze, bez Allow Cała witryna zablokowana
Disallow: *.pdf Wiele parserów to ignoruje, użyj Disallow: /*.pdf$
Adres względny wobec protokołu lub bezwzględny w Disallow Ignorowany, ścieżki muszą być względne
Kilka wierszy User-agent przed regułami Łączone; reguły dotyczą wszystkich wymienionych UA
Spacje na końcu ścieżek Po cichu traktowane jako inna ścieżka
Umieszczenie robots.txt w podkatalogu Pobierany jest tylko plik z domeny głównej

robots.txt a noindex

robots.txt każe robotom nie pobierać adresu URL. Strona, która została już zaindeksowana, a następnie zablokowana w robots.txt, może pozostać w indeksie przez miesiące, robot nie może jej pobrać, aby potwierdzić usunięcie. Jeśli chcesz ją usunąć z indeksu, użyj metatagu noindex lub nagłówka HTTP na samej stronie i pozwól robotowi go zobaczyć.

Crawl-delay

Crawl-delay: 10 prosi o 10 sekund przerwy między żądaniami. Google to ignoruje (częstotliwość indeksowania ustawisz w Search Console). Bing, Yandex i niektóre niszowe roboty go przestrzegają. Używaj go w małych witrynach obciążonych przez niszowe boty.

Czego Disallow NIE robi

  • Nie blokuje możliwości linkowania. Inne strony nadal mogą linkować do zablokowanego adresu URL, a ten pojawi się w wynikach wyszukiwania jako sam adres (bez tytułu i opisu).
  • Nie zapobiega wyświetleniu strony. Użytkownicy nadal mogą odwiedzić adres URL objęty regułą Disallow.
  • Nie ukrywa adresu URL przed światem. robots.txt jest publiczny; wypisywanie w nim tajnych ścieżek tylko je ujawnia.

Najczęściej zadawane pytania

Ponieważ Disallow blokuje indeksowanie (crawling), a nie umieszczanie w indeksie. Jeśli Google już zna adres URL (z linków lub mapy witryny), może zachować sam adres w wynikach wyszukiwania. Dodaj na stronie tag noindex i pozwól Google ją pobrać, aby potwierdzić usunięcie.

Tak. Użyj bloku User-agent: BadBot z własnymi regułami. Pamiętaj, że źle zachowujące się boty całkowicie ignorują robots.txt; przestrzegają go tylko boty działające zgodnie z zasadami.

Nie. robots.txt jest publiczny, wypisanie go ujawnia lokalizację. Zamiast tego użyj uwierzytelniania i kontroli dostępu na poziomie serwera.

Tak, w przypadku ścieżek. Disallow: /Admin/ nie blokuje /admin/. Dopasuj rzeczywistą wielkość liter swoich adresów URL.

Tak. Wypisz kilka wierszy Sitemap:, aby wskazać osobne mapy witryny XML lub indeks map witryny.

Powiązane narzędzia

Narzędzie jest dostępne w innych językach